MarkTechPost در 10 اکتبر گزارش داد که Sakana AI "Beyond Imitation" را منتشر کرده است، یک مقاله تحقیقاتی در مجله Transactions on Machine Learning Research (TMLR) که یک سیستم بررسی همتا به کمک LLM را توصیف می کند که بر اساس تشخیص خطا به جای تقلید از بررسی های انسانی ساخته شده است. بررسی ها، آیا می تواند یک اشتباه کاشته شده را پیدا کند؟

این تیم دو مصنوع ارسال کرد: یک معیار تضاد برای اندازه‌گیری تشخیص خطا، و یک سیستم بررسی چندلایه (MLR) که هر خط پایه آزمایشی را هدایت می‌کرد. نتایج در بحبوحه علاقه فزاینده به استفاده از هوش مصنوعی برای تقویت بررسی همتایان به دست می‌آیند - فرآیندی که از افزایش حجم ارسال‌ها تحت فشار است. برای اطلاعات بیشتر در مورد اینکه چگونه هوش مصنوعی در حال تغییر شکل تحقیقات است، [آخرین پیشرفت های هوش مصنوعی] ما را دنبال کنید (https://aibuzzwire.news).

معیاری از اشتباهات کاشته شده

معیار Contradiction خطاها را در مقالات واقعی قرار می‌دهد و بررسی می‌کند که آیا بازبین‌ها متوجه آن‌ها می‌شوند یا خیر. محققان 257 مقاله دارای مجوز CC از ACL، AISTATS، CVPR، و ICML 2025، به علاوه NeurIPS 2024 را جمع آوری کردند، سپس از Gemini 2.5 Pro برای ساختن نمودار دانشی از ادعاها، شواهد و روش های هر مقاله استفاده کردند.

شدت به صورت ساختاری تعریف می شود: فاصله یک گره از "ادعای اصلی" مقاله تعیین می کند که خطا تا چه حد مرکزی است. فاصله صفر به یک ادعای اصلی برخورد می کند. فواصل بزرگتر به جزئیات پشتیبان برخورد می کنند. سپس GPT-4.1 یک گره را در هر فاصله در یک تضاد بازنویسی می کند و در مجموع 1164 نقطه داده تولید می کند. داور O3 به هر بررسی ده بار امتیاز می دهد. در کاغذهای تمیز، قاضی به دقت 99.9 درصد رسید و حساسیت 86.8 درصدی را در صیدهای تأیید شده دستی نشان داد - به این معنی که نمرات تشخیص گزارش شده ممکن است در واقع محافظه کارانه باشد.

چگونه بررسی چند لایه کار می کند

MLR یک سیستم عاملی است که قبل از نقد مقاله، آن را درک می‌کند، که از سه عامل تخصصی که بر روی مدل‌های کلود خارج از قفسه اجرا می‌شوند جمع‌آوری شده است - بدون کلاستر GPU و بدون نیاز به تنظیم دقیق:

  • Appendix Agent (Claude Haiku 3.5): آزمایش ها و جزئیات پیاده سازی را از پیوست خلاصه می کند.
  • عامل بررسی ادبیات (کلود سونت 4، اختیاری): از جستجوی وب برای قرار دادن مقاله در زمینه کار قبلی استفاده می کند.
  • نماینده بررسی (Claude Sonnet 4): یک زنجیره سریع سه پاسی را اجرا می کند که با الهام از "رویکرد سه گذری" معروف دانشمند کامپیوتر S. Keshav - ابتدا یک طرح کلی سطح بالا، سپس خواندن دقیق نقاط ضعف، فرضیات، و نقاط ضعف، ادغام تمام نقاط ضعف، و در نهایت یک ادغام نقاط ضعف توصیه، امتیاز و لیست کارهایی که باید انجام دهید.

PDF مستقیماً به مدل‌ها ارسال می‌شود، بنابراین ارقام و معادلات در پردازش باقی می‌مانند. این سیستم تا 10 صفحه متن اصلی را می خواند و ساکانا هزینه را حدود 0.47 دلار برای هر بررسی تخمین می زند.

نتایج: طراحی و انتخاب مدل هر دو مهم هستند

MLR هر چهار سیستم آزمایش شده در معیار را رهبری کرد. با چهار بررسی مستقل، 73.43٪ از تضادهای ادعای اصلی (فاصله صفر) و 40.95٪ در کل را به دست آورد. بهترین خط مبنا، سیستمی به نام AgentReview، تنها 14.81 درصد از ادعاهای اصلی را مدیریت کرد. حتی یک بررسی MLR تنها 60.79٪ از خطاهای ادعای اصلی را گرفت.

مطالعه فرسایشی سهم طراحی را از انتخاب مدل جدا می کند. تعویض GPT-4.1 برای Claude Sonnet 4 در یک خط لوله بررسی موجود، تشخیص ادعای اصلی را از 14.56٪ به 35.40٪ افزایش داد، در حالی که طراحی چند عامله MLR تقریباً 25 درصد بیشتر را برای یک بررسی اضافه کرد. دقت تشخیص با دور شدن خطاها از ادعای اصلی کاهش می‌یابد، که نویسندگان می‌گویند از امتیازدهی شدت پشتیبانی می‌کند.

تصویر بر روی داده های آشفته تر و دنیای واقعی تیره می شود. در WithdrarXiv-Check، مجموعه‌ای از 211 مقاله arXiv که واقعاً پس گرفته شده‌اند، MLR امتیاز 26.07 درصد را در موارد مشابه و 16.11 درصد در موارد منطبق دقیق کسب کرد - و سیستم در برابر تزریق سریع پنهان در متن دست‌نویس آسیب‌پذیر است. به عبارت دیگر، خواندن کاغذهای پس گرفته شده واقعی بسیار دشوارتر از کشف تضادهای مصنوعی است.

چه معنایی برای بررسی همتایان دارد

کاربردی ترین نکته مطالعه ممکن است کم زرق و برق ترین آن باشد: هم طراحی سیستم و هم انتخاب مدل به طور مادی تشخیص خطا را جابجا می کنند، و بازبینانی که قبل از قضاوت مطالعه می کنند، خطاهای بسیار جدی تری نسبت به آنهایی که در متن مرور انسانی مطابقت دارند، پیدا می کنند. این تمایز اهمیت دارد زیرا بیشتر کارهای قبلی در مورد بازبینی به کمک هوش مصنوعی برای توافق با قضاوت های انسانی بهینه شده بودند - معیاری که به جای بررسی دقیق، به انطباق با صدای مطمئن پاداش می دهد.

نتایج ساکانا نشان نمی‌دهد که هوش مصنوعی برای جایگزینی داوران انسانی آماده است - سیستمی که اکثر خطاها را در کاغذهای واقعی جمع‌آوری شده از دست می‌دهد و می‌توان آن را با دستورات تعبیه‌شده دستکاری کرد، بهتر است به عنوان یک لایه کمکی تلقی شود، نه یک مرجع. خطاهای ترکیبی معیار نیز پاک‌تر از ابهامات آماری و تفاسیر بحث‌انگیز است که بر اختلاف نظر واقعی در بررسی همتایان غالب است، بنابراین عملکرد در مورد تناقضات کاشته شده باید به عنوان یک سقف خوانده شود، نه یک وعده.

اما با تقریباً 0.47 دلار در هر بررسی، با بالاترین نرخ تشخیص خطا در میان هر سیستمی که آزمایش شده است، MLR به یک دوره کوتاه اشاره می کند که در آن بازبینان هوش مصنوعی یک صفحه اول را برای تضادها کنترل می کنند در حالی که بازبینان انسانی بر روی قضاوت هایی تمرکز می کنند که ماشین ها هنوز نمی توانند انجام دهند. مجلات و سازمان‌دهندگان کنفرانسی که با بررسی به کمک LLM آزمایش می‌کنند، اکنون هم یک معیار عمومی و هم یک پایه قوی برای اندازه‌گیری سیستم‌های خود دارند - و اگر شکاف بین 73.43٪ و 14.81٪ حفظ شود، سیگنال واضحی است که خواندن معماری بیش از اندازه مدل خام اهمیت دارد.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →