MarkTechPost در 10 اکتبر گزارش داد که Sakana AI "Beyond Imitation" را منتشر کرده است، یک مقاله تحقیقاتی در مجله Transactions on Machine Learning Research (TMLR) که یک سیستم بررسی همتا به کمک LLM را توصیف می کند که بر اساس تشخیص خطا به جای تقلید از بررسی های انسانی ساخته شده است. بررسی ها، آیا می تواند یک اشتباه کاشته شده را پیدا کند؟
این تیم دو مصنوع ارسال کرد: یک معیار تضاد برای اندازهگیری تشخیص خطا، و یک سیستم بررسی چندلایه (MLR) که هر خط پایه آزمایشی را هدایت میکرد. نتایج در بحبوحه علاقه فزاینده به استفاده از هوش مصنوعی برای تقویت بررسی همتایان به دست میآیند - فرآیندی که از افزایش حجم ارسالها تحت فشار است. برای اطلاعات بیشتر در مورد اینکه چگونه هوش مصنوعی در حال تغییر شکل تحقیقات است، [آخرین پیشرفت های هوش مصنوعی] ما را دنبال کنید (https://aibuzzwire.news).
معیاری از اشتباهات کاشته شده
معیار Contradiction خطاها را در مقالات واقعی قرار میدهد و بررسی میکند که آیا بازبینها متوجه آنها میشوند یا خیر. محققان 257 مقاله دارای مجوز CC از ACL، AISTATS، CVPR، و ICML 2025، به علاوه NeurIPS 2024 را جمع آوری کردند، سپس از Gemini 2.5 Pro برای ساختن نمودار دانشی از ادعاها، شواهد و روش های هر مقاله استفاده کردند.
شدت به صورت ساختاری تعریف می شود: فاصله یک گره از "ادعای اصلی" مقاله تعیین می کند که خطا تا چه حد مرکزی است. فاصله صفر به یک ادعای اصلی برخورد می کند. فواصل بزرگتر به جزئیات پشتیبان برخورد می کنند. سپس GPT-4.1 یک گره را در هر فاصله در یک تضاد بازنویسی می کند و در مجموع 1164 نقطه داده تولید می کند. داور O3 به هر بررسی ده بار امتیاز می دهد. در کاغذهای تمیز، قاضی به دقت 99.9 درصد رسید و حساسیت 86.8 درصدی را در صیدهای تأیید شده دستی نشان داد - به این معنی که نمرات تشخیص گزارش شده ممکن است در واقع محافظه کارانه باشد.
چگونه بررسی چند لایه کار می کند
MLR یک سیستم عاملی است که قبل از نقد مقاله، آن را درک میکند، که از سه عامل تخصصی که بر روی مدلهای کلود خارج از قفسه اجرا میشوند جمعآوری شده است - بدون کلاستر GPU و بدون نیاز به تنظیم دقیق:
- Appendix Agent (Claude Haiku 3.5): آزمایش ها و جزئیات پیاده سازی را از پیوست خلاصه می کند.
- عامل بررسی ادبیات (کلود سونت 4، اختیاری): از جستجوی وب برای قرار دادن مقاله در زمینه کار قبلی استفاده می کند.
- نماینده بررسی (Claude Sonnet 4): یک زنجیره سریع سه پاسی را اجرا می کند که با الهام از "رویکرد سه گذری" معروف دانشمند کامپیوتر S. Keshav - ابتدا یک طرح کلی سطح بالا، سپس خواندن دقیق نقاط ضعف، فرضیات، و نقاط ضعف، ادغام تمام نقاط ضعف، و در نهایت یک ادغام نقاط ضعف توصیه، امتیاز و لیست کارهایی که باید انجام دهید.
PDF مستقیماً به مدلها ارسال میشود، بنابراین ارقام و معادلات در پردازش باقی میمانند. این سیستم تا 10 صفحه متن اصلی را می خواند و ساکانا هزینه را حدود 0.47 دلار برای هر بررسی تخمین می زند.
نتایج: طراحی و انتخاب مدل هر دو مهم هستند
MLR هر چهار سیستم آزمایش شده در معیار را رهبری کرد. با چهار بررسی مستقل، 73.43٪ از تضادهای ادعای اصلی (فاصله صفر) و 40.95٪ در کل را به دست آورد. بهترین خط مبنا، سیستمی به نام AgentReview، تنها 14.81 درصد از ادعاهای اصلی را مدیریت کرد. حتی یک بررسی MLR تنها 60.79٪ از خطاهای ادعای اصلی را گرفت.
مطالعه فرسایشی سهم طراحی را از انتخاب مدل جدا می کند. تعویض GPT-4.1 برای Claude Sonnet 4 در یک خط لوله بررسی موجود، تشخیص ادعای اصلی را از 14.56٪ به 35.40٪ افزایش داد، در حالی که طراحی چند عامله MLR تقریباً 25 درصد بیشتر را برای یک بررسی اضافه کرد. دقت تشخیص با دور شدن خطاها از ادعای اصلی کاهش مییابد، که نویسندگان میگویند از امتیازدهی شدت پشتیبانی میکند.
تصویر بر روی داده های آشفته تر و دنیای واقعی تیره می شود. در WithdrarXiv-Check، مجموعهای از 211 مقاله arXiv که واقعاً پس گرفته شدهاند، MLR امتیاز 26.07 درصد را در موارد مشابه و 16.11 درصد در موارد منطبق دقیق کسب کرد - و سیستم در برابر تزریق سریع پنهان در متن دستنویس آسیبپذیر است. به عبارت دیگر، خواندن کاغذهای پس گرفته شده واقعی بسیار دشوارتر از کشف تضادهای مصنوعی است.
چه معنایی برای بررسی همتایان دارد
کاربردی ترین نکته مطالعه ممکن است کم زرق و برق ترین آن باشد: هم طراحی سیستم و هم انتخاب مدل به طور مادی تشخیص خطا را جابجا می کنند، و بازبینانی که قبل از قضاوت مطالعه می کنند، خطاهای بسیار جدی تری نسبت به آنهایی که در متن مرور انسانی مطابقت دارند، پیدا می کنند. این تمایز اهمیت دارد زیرا بیشتر کارهای قبلی در مورد بازبینی به کمک هوش مصنوعی برای توافق با قضاوت های انسانی بهینه شده بودند - معیاری که به جای بررسی دقیق، به انطباق با صدای مطمئن پاداش می دهد.
نتایج ساکانا نشان نمیدهد که هوش مصنوعی برای جایگزینی داوران انسانی آماده است - سیستمی که اکثر خطاها را در کاغذهای واقعی جمعآوری شده از دست میدهد و میتوان آن را با دستورات تعبیهشده دستکاری کرد، بهتر است به عنوان یک لایه کمکی تلقی شود، نه یک مرجع. خطاهای ترکیبی معیار نیز پاکتر از ابهامات آماری و تفاسیر بحثانگیز است که بر اختلاف نظر واقعی در بررسی همتایان غالب است، بنابراین عملکرد در مورد تناقضات کاشته شده باید به عنوان یک سقف خوانده شود، نه یک وعده.
اما با تقریباً 0.47 دلار در هر بررسی، با بالاترین نرخ تشخیص خطا در میان هر سیستمی که آزمایش شده است، MLR به یک دوره کوتاه اشاره می کند که در آن بازبینان هوش مصنوعی یک صفحه اول را برای تضادها کنترل می کنند در حالی که بازبینان انسانی بر روی قضاوت هایی تمرکز می کنند که ماشین ها هنوز نمی توانند انجام دهند. مجلات و سازماندهندگان کنفرانسی که با بررسی به کمک LLM آزمایش میکنند، اکنون هم یک معیار عمومی و هم یک پایه قوی برای اندازهگیری سیستمهای خود دارند - و اگر شکاف بین 73.43٪ و 14.81٪ حفظ شود، سیگنال واضحی است که خواندن معماری بیش از اندازه مدل خام اهمیت دارد.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →