نشرت شركة Sakana AI ورقة بحثية بعنوان "ما وراء التقليد" في مجلة Transactions on Machine Learning Research (TMLR) تصف نظام مراجعة النظراء المدعوم من LLM والمبني على اكتشاف الأخطاء بدلاً من تقليد المراجعات البشرية، وذلك حسبما أفاد موقع MarkTechPost في 10 أكتوبر. والسؤال المركزي الذي شرع المختبر الذي يقع مقره في طوكيو في الإجابة عليه: بدلاً من تصنيف مراجع الذكاء الاصطناعي على أساس مدى تطابق مخرجاته مع المراجعات البشرية، هل يمكنه العثور على خطأ مزروع؟
قام الفريق بشحن قطعتين أثريتين: معيار التناقض لقياس اكتشاف الأخطاء، ونظام المراجعة متعدد الطبقات (MLR) الذي قاد كل اختبار أساسي. تصل هذه النتائج وسط اهتمام متزايد باستخدام الذكاء الاصطناعي لدعم مراجعة النظراء، وهي عملية تتعرض لضغوط بسبب ارتفاع حجم الطلبات المقدمة. لمزيد من المعلومات حول كيفية إعادة تشكيل الذكاء الاصطناعي للأبحاث نفسها، تابع [آخر تطورات الذكاء الاصطناعي] (https://aibuzzwire.news).
معيار الأخطاء المزروعة
يزرع مقياس التناقض الأخطاء في الأوراق الحقيقية ويتحقق مما إذا كان المراجعون قد اكتشفوها أم لا. جمع الباحثون 257 ورقة بحثية مرخصة من CC من ACL وAISTATS وCVPR وICML 2025، بالإضافة إلى NeurIPS 2024، ثم استخدموا Gemini 2.5 Pro لبناء رسم بياني معرفي لادعاءات كل ورقة وأدلتها وطرقها.
يتم تعريف الخطورة من الناحية الهيكلية: تحدد مسافة العقدة من "المطالبة الرئيسية" للورقة مدى مركزية الخطأ. المسافة صفر تصل إلى المطالبة الأساسية؛ تصل المسافات الأكبر إلى التفاصيل الداعمة. يقوم GPT-4.1 بعد ذلك بإعادة كتابة عقدة واحدة لكل مسافة في تناقض، مما ينتج عنه إجمالي 1164 نقطة بيانات. يقوم القاضي o3 بتسجيل كل مراجعة عشر مرات. في الأوراق النظيفة، وصل القاضي إلى دقة تصل إلى 99.9%، وأظهر حساسية بنسبة 86.8% على عمليات الصيد المؤكدة يدويًا - مما يعني أن درجات الكشف المبلغ عنها قد تكون في الواقع متحفظة.
كيف تعمل المراجعة متعددة الطبقات
MLR هو نظام وكيل يفهم الورقة قبل نقدها، ويتم تجميعه من ثلاثة وكلاء متخصصين يعملون على نماذج Claude الجاهزة للاستخدام - لا توجد مجموعة GPU ولا يلزم إجراء ضبط دقيق:
- وكيل الملحق (كلود هايكو 3.5): يلخص التجارب وتفاصيل التنفيذ من الملحق.
- وكيل مراجعة الأدبيات (كلود سونيت 4، اختياري): يستخدم بحث الويب لوضع الورقة في سياق العمل السابق.
- وكيل المراجعة (كلود سونيت 4): يدير سلسلة موجهة من ثلاثة تمريرات مستوحاة من "نهج التمريرات الثلاثة" الشهير لعالم الكمبيوتر س. كيشاف - أولًا مخطط تفصيلي عالي المستوى، ثم قراءة تفصيلية لنقاط الضعف والافتراضات والفجوات، وأخيرًا دمج جميع مخرجات الوكيل في نقاط القوة والضعف والأسئلة والتوصية والنتيجة وقائمة المهام.
يتم تمرير ملف PDF إلى النماذج مباشرةً، بحيث تظل الأرقام والمعادلات قيد المعالجة. يقرأ النظام ما يصل إلى 10 صفحات من النص الرئيسي، وتقدر سكنا التكلفة بنحو 0.47 دولار لكل مراجعة.
النتائج: التصميم واختيار النموذج مهمان
قاد MLR جميع الأنظمة الأربعة التي تم اختبارها وفقًا للمعايير. من خلال أربع مراجعات مستقلة، حصلت على 73.43% من تناقضات الادعاء الأساسي (مسافة الصفر) و40.95% بشكل عام. أفضل خط أساس، وهو نظام يسمى AgentReview، تمكن من تحقيق 14.81% فقط من المطالبات الأساسية. حتى مراجعة MLR واحدة اكتشفت 60.79% من أخطاء المطالبات الأساسية.
تفصل دراسة الاجتثاث مساهمة التصميم عن اختيار النموذج. يؤدي تبديل GPT-4.1 لـ Claude Sonnet 4 داخل مسار المراجعة الحالي إلى رفع نسبة اكتشاف المطالبات الأساسية من 14.56% إلى 35.40%، في حين أضاف تصميم MLR متعدد الوكلاء ما يقرب من 25 نقطة مئوية إضافية في الأعلى لمراجعة واحدة. تنخفض دقة الاكتشاف مع ابتعاد الأخطاء عن الادعاء الرئيسي، والذي يقول المؤلفون إنه يدعم درجة الخطورة.
تصبح الصورة مظلمة عندما يتعلق الأمر ببيانات العالم الحقيقي الأكثر فوضوية. في WithdrarXiv-Check، وهي مجموعة مكونة من 211 ورقة بحثية تم سحبها بالفعل من arXiv، سجل MLR 26.07% على المطابقات "المشابهة" و16.11% على المطابقات التامة - ويظل النظام عرضة للحقن الفوري المخفي المزروع في نص المخطوطة. وبعبارة أخرى، فإن قراءة الأبحاث الحقيقية المسحوبة أصعب بكثير من التقاط التناقضات الاصطناعية.
ماذا يعني ذلك بالنسبة لمراجعة النظراء
قد تكون أهم استنتاجات الدراسة العملية هي الأقل بريقًا: فكل من تصميم النظام واختيار النموذج يحركان عملية اكتشاف الأخطاء بشكل ملموس، والمراجعون الذين يقرؤون قبل الحكم يجدون أخطاء أكثر خطورة بكثير من تلك التي تتطابق مع النمط في نص المراجعة البشرية. هذا التمييز مهم لأن معظم الأعمال السابقة المتعلقة بالمراجعة بمساعدة الذكاء الاصطناعي تم تحسينها للاتفاق مع الأحكام البشرية - وهو مقياس يكافئ الامتثال الذي يبدو واثقًا بدلاً من التدقيق الحقيقي.
لا تشير نتائج ساكانا إلى أن الذكاء الاصطناعي جاهز ليحل محل الحكام البشريين. فمن الأفضل التعامل مع النظام الذي يخطئ في معظم الأخطاء في الأوراق الحقيقية المسحوبة، ويمكن التلاعب به من خلال المطالبات المضمنة، باعتباره طبقة مساعدة، وليس سلطة. كما أن الأخطاء الاصطناعية في المعيار أكثر وضوحاً من الغموض الإحصائي والتفسيرات المتنازع عليها التي تهيمن على الخلاف الحقيقي في مراجعة النظراء، لذا فإن الأداء على التناقضات المزروعة لابد أن يُقرأ باعتباره سقفاً، وليس وعداً.
ولكن بسعر 0.47 دولار تقريبًا لكل مراجعة، مع أعلى معدل لاكتشاف الأخطاء في أي نظام تم اختباره، يشير MLR إلى المدى القريب حيث يتعامل مراجعو الذكاء الاصطناعي مع شاشة المرور الأولى للتناقضات بينما يركز المراجعون البشريون على قرارات الحكم التي لا تزال الآلات غير قادرة على إصدارها. أصبح لدى المجلات ومنظمي المؤتمرات الذين يقومون بتجربة المراجعة بمساعدة ماجستير إدارة الأعمال الآن معيار عام وخط أساس قوي لقياس أنظمتهم الخاصة في مقابل ذلك - وإذا ظلت الفجوة بين 73.43% و14.81% قائمة، فهذه إشارة واضحة إلى أن بنية القراءة أكثر أهمية من حجم النموذج الخام.
---
ابقَ في طليعة الذكاء الاصطناعياحصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →