Sakana AI نے "Beyond Imitation" شائع کیا ہے، ٹرانزیکشنز آن مشین لرننگ ریسرچ (TMLR) جریدے میں ایک تحقیقی مقالہ جس میں LLM کی مدد سے پیئر ریویو سسٹم کی وضاحت کی گئی ہے جو انسانی جائزوں کی تقلید کے بجائے غلطی کا پتہ لگانے کے ارد گرد بنایا گیا ہے، مارک ٹیک پوسٹ نے 10 اکتوبر کو اطلاع دی۔ اس کا آؤٹ پٹ انسانی جائزوں سے میل کھاتا ہے، کیا اس میں لگائی گئی غلطی مل سکتی ہے؟
ٹیم نے دو نمونے بھیجے: غلطی کا پتہ لگانے کے لیے ایک تضاد بینچ مارک، اور ایک ملٹی لیئرڈ ریویو (MLR) سسٹم جس کی وجہ سے ہر بیس لائن کی جانچ کی گئی۔ ہم مرتبہ کے جائزے کو آگے بڑھانے کے لیے AI کے استعمال میں بڑھتی ہوئی دلچسپی کے درمیان نتائج سامنے آتے ہیں - جمع کرانے کی بڑھتی ہوئی مقدار سے دباؤ کا ایک عمل۔ اس بارے میں مزید جاننے کے لیے کہ AI کس طرح خود تحقیق کو نئی شکل دے رہا ہے، ہماری تازہ ترین AI پیش رفت* پر عمل کریں۔
لگائی گئی غلطیوں کا ایک معیار
تضاد بینچ مارک غلطیوں کو اصلی کاغذات میں ڈالتا ہے اور جانچتا ہے کہ آیا جائزہ لینے والے انہیں پکڑتے ہیں۔ محققین نے ACL، AISTATS، CVPR، اور ICML 2025 کے علاوہ NeurIPS 2024 سے 257 CC-لائسنس شدہ کاغذات جمع کیے، پھر Gemini 2.5 Pro کا استعمال ہر کاغذ کے دعووں، ثبوتوں اور طریقوں کا علمی گراف بنانے کے لیے کیا۔
شدت کو ساختی طور پر بیان کیا جاتا ہے: کاغذ کے "مین کلیم" سے نوڈ کا فاصلہ طے کرتا ہے کہ غلطی کتنی مرکزی ہے۔ فاصلہ صفر ایک بنیادی دعوے سے ٹکرا جاتا ہے۔ بڑے فاصلے معاون تفصیلات کو نشانہ بناتے ہیں۔ GPT-4.1 پھر ایک نوڈ فی فاصلے کو ایک تضاد میں دوبارہ لکھتا ہے، جس سے مجموعی طور پر 1,164 ڈیٹا پوائنٹس تیار ہوتے ہیں۔ ایک o3 جج ہر جائزے کو دس بار اسکور کرتا ہے۔ صاف کاغذات پر جج 99.9% درستگی تک پہنچ گیا، اور اس نے دستی طور پر تصدیق شدہ کیچز پر 86.8% حساسیت ظاہر کی — یعنی اطلاع دی گئی کھوج کے اسکور دراصل قدامت پسند ہو سکتے ہیں۔
ملٹی لیئرڈ ریویو کیسے کام کرتا ہے۔
MLR ایک ایجنٹی نظام ہے جو کسی کاغذ پر تنقید کرنے سے پہلے اسے سمجھتا ہے، تین خصوصی ایجنٹوں سے جو آف دی شیلف کلاڈ ماڈلز پر چل رہے ہیں - کسی GPU کلسٹر اور فائن ٹیوننگ کی ضرورت نہیں ہے:
- اپینڈکس ایجنٹ (کلاڈ ہائیکو 3.5): اپینڈکس سے تجربات اور عمل درآمد کی تفصیلات کا خلاصہ کرتا ہے۔
- لٹریچر ریویو ایجنٹ (کلاڈ سونیٹ 4، اختیاری): سابقہ کام کے تناظر میں کاغذ رکھنے کے لیے ویب سرچ کا استعمال کرتا ہے۔
- ریویو ایجنٹ (کلاڈ سونیٹ 4): کمپیوٹر سائنس دان ایس کیشو کے معروف "تھری پاس اپروچ" سے متاثر ایک تھری پاس پرامپٹ سلسلہ چلاتا ہے — پہلے ایک اعلیٰ سطحی خاکہ، پھر کمزوریوں، مفروضوں، اور فرقوں کو تفصیلی پڑھا جاتا ہے، اور آخر میں ایک کمزوری، تمام سوالوں کی طاقت، کمزوری، کمزوری، کو واضح کرتا ہے۔ سفارش، ایک سکور، اور کرنے کی فہرست۔
پی ڈی ایف کو براہ راست ماڈلز تک پہنچایا جاتا ہے، اس لیے اعداد و شمار اور مساوات پروسیسنگ سے بچ جاتے ہیں۔ سسٹم مین ٹیکسٹ کے 10 صفحات تک پڑھتا ہے، اور ساکانہ نے فی جائزہ $0.47 لاگت کا تخمینہ لگایا ہے۔
نتائج: ڈیزائن اور ماڈل کا انتخاب دونوں اہم ہیں۔
MLR نے بینچ مارک پر جانچے گئے چاروں سسٹم کی قیادت کی۔ چار آزاد جائزوں کے ساتھ، اس نے 73.43% بنیادی دعوے (فاصلہ صفر) تضادات اور مجموعی طور پر 40.95% کو پکڑا۔ بہترین بیس لائن، AgentReview نامی ایک نظام، بنیادی دعووں پر صرف 14.81 فیصد کا انتظام کر سکا۔ یہاں تک کہ ایک واحد MLR جائزے میں 60.79% بنیادی دعوے کی غلطیاں پکڑی گئیں۔
ختم کرنے کا مطالعہ ماڈل کے انتخاب سے ڈیزائن کی شراکت کو الگ کرتا ہے۔ موجودہ ریویو پائپ لائن کے اندر Claude Sonnet 4 کے لیے GPT-4.1 کو تبدیل کرنے سے کور کلیم ڈٹیکشن کو 14.56% سے بڑھا کر 35.40% کر دیا گیا، جب کہ MLR کے ملٹی ایجنٹ ڈیزائن نے ایک جائزے کے لیے تقریباً 25 فیصد مزید پوائنٹس کا اضافہ کیا۔ کھوج کی درستگی اس وقت گرتی ہے جب غلطیاں اہم دعوے سے ہٹ جاتی ہیں، جسے مصنفین کہتے ہیں کہ شدت کے اسکورنگ کی حمایت کرتا ہے۔
تصویر گڑبڑ، حقیقی دنیا کے ڈیٹا پر سیاہ ہو جاتی ہے۔ WithdrarXiv-Check پر، 211 کے ایک سیٹ نے اصل میں arXiv کاغذات کو واپس لے لیا، MLR نے "ملتے جلتے" میچوں پر 26.07% اور عین مطابق میچوں پر 16.11% اسکور کیے — اور نظام مخطوطہ کے متن میں لگائے گئے پوشیدہ فوری انجیکشن کے لیے خطرے سے دوچار ہے۔ دوسرے لفظوں میں، اصلی پیچھے ہٹے ہوئے کاغذات کو پڑھنا مصنوعی تضادات کو پکڑنے سے کہیں زیادہ مشکل ہے۔
پیر ریویو کے لیے اس کا کیا مطلب ہے۔
مطالعہ کا سب سے زیادہ عملی راستہ اس کا کم سے کم دلکش ہوسکتا ہے: سسٹم ڈیزائن اور ماڈل کا انتخاب دونوں ہی مادی طور پر غلطی کا پتہ لگانے کو آگے بڑھاتے ہیں، اور جائزہ لینے والے جو فیصلہ کرنے سے پہلے پڑھتے ہیں ان سے کہیں زیادہ سنگین غلطیاں تلاش کرتے ہیں جو انسانی جائزے کے متن پر پیٹرن سے ملتی ہیں۔ یہ فرق اہمیت رکھتا ہے کیونکہ AI کی مدد سے جائزے پر سب سے پہلے کا کام انسانی فیصلوں کے ساتھ معاہدے کے لیے موزوں ہے - ایک ایسا میٹرک جو حقیقی جانچ پڑتال کے بجائے پراعتماد آواز کی مطابقت کا بدلہ دیتا ہے۔
Sakana کے نتائج یہ تجویز نہیں کرتے ہیں کہ AI انسانی ریفریز کو تبدیل کرنے کے لیے تیار ہے - ایک ایسا نظام جو حقیقی واپسی کے کاغذات میں زیادہ تر غلطیوں سے محروم ہو جاتا ہے اور ایمبیڈڈ پرامپٹس کے ذریعے ہیرا پھیری کی جا سکتی ہے، اسے ایک معاون پرت کے طور پر سمجھا جاتا ہے، نہ کہ اتھارٹی۔ بینچ مارک کی مصنوعی غلطیاں اعداد و شمار کے ابہام اور متنازعہ تشریحات سے بھی زیادہ صاف ہیں جو ہم مرتبہ کے جائزے میں حقیقی اختلاف پر حاوی ہیں، اس لیے لگائے گئے تضادات پر کارکردگی کو ایک حد کے طور پر پڑھا جانا چاہیے، نہ کہ وعدہ۔
لیکن تقریباً $0.47 فی جائزہ پر، کسی بھی سسٹم کی جانچ کی گئی سب سے زیادہ خرابی کی نشاندہی کی شرح کے ساتھ، MLR قریب کی مدت کی طرف اشارہ کرتا ہے جہاں AI جائزہ لینے والے تضادات کے لیے فرسٹ پاس اسکرین کو ہینڈل کرتے ہیں جب کہ انسانی جائزہ لینے والے فیصلے پر توجہ مرکوز کرتے ہیں جو مشینیں اب بھی نہیں کر سکتیں۔ LLM کی مدد سے جائزے کے ساتھ تجربہ کرنے والے جرائد اور کانفرنس کے منتظمین کے پاس اب عوامی بینچ مارک اور ان کے اپنے سسٹمز کی پیمائش کرنے کے لیے ایک مضبوط بیس لائن ہے - اور، اگر 73.43% اور 14.81% کے درمیان فرق برقرار رہتا ہے، تو یہ واضح اشارہ ہے کہ آرکیٹیکچر کو پڑھنا خام ماڈل کے سائز سے زیادہ اہمیت رکھتا ہے۔
---
AI سے آگے رہیںتازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔
مزید AI خبریں پڑھیں →