Decentralized AI lab Prime Intellect نے ایک بڑے پیمانے پر تجربے کے نتائج شائع کیے ہیں جس کی جانچ کی جاتی ہے کہ آج کے فرنٹیئر AI ماڈلز خود مختار مشین لرننگ ریسرچ کو کس حد تک انجام دے سکتے ہیں - اور ان میں سے بہترین ایک مشہور کمیونٹی بینچ مارک پر انسانی عالمی ریکارڈ سے مماثلت کے قابل ذکر حد تک قریب آئے ہیں۔
پراجیکٹ، جسے NanoGPT Speedrun Frontier کا نام دیا گیا اور 22 اگست کو شائع ہوا، 18 فرنٹیئر ماڈلز پر مشتمل 153 خود مختار رنز پر مشتمل ہے جو nanoGPT آپٹیمائزر سپیڈرن کی کوشش کرتے ہیں - ایک مقابلہ جس میں محققین ایک چھوٹی زبان کے ماڈل کو ایک مقررہ معیار کے ہدف تک تربیت دینے کا سب سے موثر طریقہ تلاش کرتے ہیں۔ یہ کہانی تیزی سے ہیکر نیوز کے صفحہ اول پر چڑھ گئی، جہاں اس نے درجنوں تبصرے کیے جس پر بحث کی گئی کہ حقیقی سائنسی دریافت کے لیے AI کی صلاحیت کے بارے میں نتائج کیا کہتے ہیں۔ For more context on this story, see our ongoing AI industry coverage.
نینو جی پی ٹی اسپیڈرن دراصل کیا ہے۔
بینچ مارک کیلر جارڈن کے زیر انتظام modded-nanogpt ذخیرہ اور کمیونٹی شراکت داروں کی ایک طویل فہرست سے آتا ہے۔ چیلنج کو بیان کرنا دھوکہ دہی سے آسان ہے: 8 NVIDIA H100 GPUs کا استعمال کرتے ہوئے، ایک زبان کے ماڈل کو تربیت دیں جو FineWeb توثیق سیٹ پر 3.28 کراس اینٹروپی نقصان تک پہنچ جائے — کارکردگی کی سطح Andrej Karpathy کی اصل GPT-2 نقل 45 منٹ کے بعد پہنچ گئی — جتنی جلدی ممکن ہو۔
پچھلے دو سالوں میں کمیونٹی کے سینکڑوں تعاون کے ذریعے، انسانی ریکارڈ کو 75 سیکنڈ سے کم اور 400 ملین ٹریننگ ٹوکنز سے کم کر دیا گیا ہے، جو کہ اصل ترکیب کے مقابلے میں 30 گنا زیادہ بہتری ہے۔ جیتنے والے حل جدید ML انجینئرنگ کے کیٹلاگ کی طرح پڑھے جاتے ہیں: Muon آپٹیمائزر، QK-Norm کے ساتھ روٹری ایمبیڈنگز، ReLU-squared ایکٹیویشنز، FP8 کوانٹائزیشن پر توجہ اور MLP پاسز، فلیش اٹینشن 3 سلائیڈنگ ونڈو پیٹرن کے ساتھ، اور درجنوں دیگر تکنیکیں ایک دوسرے پر اسٹیک ہیں۔
پرائم انٹیلیکٹ کے ٹیسٹ میں بینچ مارک کے آپٹیمائزر ٹریک کا استعمال کیا گیا، جو کہ — مخزن کی دستاویزات کے مطابق — مؤثر طریقے سے لامحدود وال کلاک بجٹ کے ساتھ، ایک مقررہ فن تعمیر، ڈیٹاسیٹ، اور بیچ سائز کے تحت ہدف کے نقصان کو پورا کرنے کے لیے درکار تربیتی اقدامات کی تعداد کو کم کرتا ہے۔ یہ خام ہارڈ ویئر کی رفتار کے بجائے الگورتھم کی دریافت کا خالص امتحان بناتا ہے۔
تجربہ کیسے کام کرتا ہے۔
18 ماڈلز میں سے ہر ایک کو خود مختاری سے یہ کام دیا گیا تھا: تربیتی نسخہ میں تبدیلیاں تجویز کریں، تجربات چلائیں، نتائج کا معائنہ کریں، اور اعادہ کریں — ایک مقررہ تصدیقی اسکرپٹ اور فکسڈ رینڈم سیڈز کے ساتھ اس بات کو یقینی بناتے ہوئے کہ دعوی کردہ بہتری خوش قسمتی کی بجائے حقیقی ہے۔ جیسا کہ ہیکر نیوز کے ایک تبصرہ نگار نے اس کا خلاصہ کیا، ماڈلز سے کہا گیا کہ وہ تحقیق کریں کہ چھوٹے ماڈل کی تربیت کو کیسے بہتر بنایا جائے، بار بار تبدیلیوں کی کوشش کی جائے، ان کی جانچ کی جائے، اور نتائج کو استعمال کرتے ہوئے یہ فیصلہ کیا جائے کہ آگے کیا کوشش کرنی ہے۔
ماڈلز نے متعدد ایجنٹوں کے استعمال کے ذریعے کام کیا — بشمول کلاڈ کوڈ، اوپن اے آئی کا کوڈیکس، کیمی کوڈ، گروک-کلی، کیوین کوڈ، اور پرائم انٹیلیکٹ کا اپنا پرائم ایجنٹ — اور ٹیم نے ہر رن کے ٹوکن کی کھپت، تجرباتی تعداد، ٹول کالز، اور ایجنٹ کے گزرے ہوئے وقت کو ٹریک کیا۔ مجموعی طور پر، تجربے نے فی ٹاپ ماڈل لاکھوں ٹوکنز اور پورے گرڈ میں اربوں کا استعمال کیا۔
لیڈر بورڈ: افسانہ 5 پیک کی قیادت کرتا ہے۔
سرخی کا نتیجہ: فیبل 5 کے نام سے شناخت شدہ ماڈل، جو کلاڈ کوڈ کے استعمال سے چل رہا ہے، نے بیس لائن ریسیپی اور انسانی ریکارڈ کے درمیان 81.7 فیصد فرق کو ختم کر دیا، لیڈر بورڈ کے میٹرک پر 2,726 کے بہترین توثیق شدہ نتیجہ کے ساتھ۔ وہاں پہنچنے میں 8.7 دن کا مجموعی ایجنٹ کا وقت، تقریباً 800 ملین ٹوکن، 811 تجربات، اور تقریباً 3,000 ٹول کالز لگے۔
پیچھا کرنے والے پیک کی قیادت Opus 5 نے کی، جس نے 53.6 فیصد فرق کو بند کر دیا، اس کے بعد Kimi K3 52.2 فیصد پر جب پرائم انٹیلیکٹ کے پرائم ایجنٹ ہارنس (اور 45.8 فیصد کیمی کوڈ کے ذریعے) چلا گیا۔ Opus 4.8 نے 39.4 فیصد کا انتظام کیا، کئی GPT-5.6 ویریئنٹس تقریباً 11 اور 36 فیصد کے درمیان، سونیٹ 5 نے 26.8 فیصد بند کیا، اور Grok 4.5 اور Qwen3.8 Max ہر ایک تقریباً 24.6 فیصد تک پہنچ گیا۔
مزید نیچے، DeepSeek V4 Pro نے 12.3 فیصد فرق کو بند کیا، GPT-5.5 8.1 فیصد تک پہنچ گیا، اور پرانا Kimi K2.7 7.2 فیصد پر ختم ہوا۔ خاص طور پر، حال ہی میں جاری کردہ ایک ماڈل — GLM 5.3 — ابھی تک اشاعت کے وقت چل رہا تھا جس کا ابھی تک کوئی تصدیق شدہ ریکارڈ نہیں تھا، ایک یاد دہانی کہ بینچ مارک ان ماڈلز کو سزا دیتا ہے جو اپنی بہتری کو قابل اعتماد طور پر درست نہیں کر سکتے۔
یہ کیوں اہمیت رکھتا ہے۔
بینچ مارک اس معاملے کو پسند کرتے ہیں کیونکہ وہ کسی چیز کی پیمائش کرتے ہیں جو کوڈنگ لیڈر بورڈز نہیں کر سکتے ہیں: ایک حقیقی تحقیقی لوپ کو چلانے کی صلاحیت — مفروضہ، تجربہ، تجزیہ، نظر ثانی — منٹوں کے بجائے دنوں میں۔ یہ قابلیت خود مختار AI تحقیق کے ابھرتے ہوئے میدان کی بنیاد ہے، جس میں ایجنٹوں کو کوڈ لکھنے کے لیے نہیں بلکہ ان چیزوں کو دریافت کرنے کا کام سونپا جاتا ہے جو کسی نے انہیں نہیں دکھائی ہیں۔
نتائج میں پھیلاؤ خود معلوماتی ہے۔ تجربے میں تقریباً ہر ماڈل نے ایک ہی بنیادی جیتنے والے آئیڈیاز پائے، پروجیکٹ کی تحریر کے مطابق - جس چیز نے بہترین رنز کو الگ کیا وہ تھا جو ایک تجربہ چھوڑتا ہے: مضبوط ایجنٹوں نے شور کے نتائج میں کمزور سگنلز کو کافی دیر تک محفوظ رکھا تاکہ ان کی توثیق ہو سکے، اور اپنے تجرباتی ڈیٹا کو بہتر طور پر سمجھا جائے۔
کمیونٹی کی طرف سے انتباہات
ہیکر نیوز کے تبصرہ کرنے والوں نے منصفانہ طریقہ کار کے نکات اٹھائے۔ تمام ماڈلز میں کوشش کی ترتیبات اور استعمال مختلف ہوتے ہیں — Fable 5 ایک اعلی استدلال کی ترتیب پر چلتا ہے جبکہ Opus 5 max پر چلتا ہے — اور 18 ماڈلز میں 153 رنز کے ریاضی کا مطلب ہے کہ کچھ ماڈلز کو دوسروں کے مقابلے میں زیادہ کوششیں ملی ہیں۔ آیا ماڈل کی درجہ بندی اس کی خام تحقیقی صلاحیت کی عکاسی کرتی ہے یا اس کے استعمال کا معیار ایک کھلا سوال ہے۔
پھر بھی سفر کی سمت واضح ہے۔ جب تیز ترین انسانی ہاتھوں کو موجودہ ریکارڈ تک پہنچنے کے لیے برسوں کی اجتماعی کوششیں لگیں، بہترین خود مختار ایجنٹس اب اس فرق کو ایک ہفتے کے حساب سے تھوڑی دیر میں ختم کر رہے ہیں۔ اگلا سوال - کیا کوئی ماڈل باقی 18.3 فیصد کو بند کر سکتا ہے - توقع سے جلد جواب دیا جا سکتا ہے۔
بینچ مارکس اور تحقیق کے بارے میں مزید جاننے کے لیے AI کی سرحد کو تشکیل دینے کے لیے، AI Buzz Wire کی مسلسل کوریج کی پیروی کریں۔
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →