آزمایشگاه غیرمتمرکز هوش مصنوعی Prime Intellect نتایج آزمایشی در مقیاس بزرگ را منتشر کرده است که آزمایش میکند مدلهای هوش مصنوعی امروزی چقدر میتوانند تحقیقات یادگیری ماشینی مستقل را انجام دهند - و بهترین آنها به طور قابلتوجهی به تطابق با رکورد جهانی انسان در یک معیار مشهور جامعه نزدیک شدهاند.
این پروژه که NanoGPT Speedrun Frontier نامیده شد و در 22 آگوست منتشر شد، شامل 153 اجرا مستقل در 18 مدل مرزی بود که سعی در سرعت اجرای بهینه ساز nanoGPT داشتند - رقابتی که در آن محققان به دنبال کارآمدترین راه برای آموزش یک مدل زبان کوچک با هدف کیفیت ثابت هستند. این داستان به سرعت در صفحه اول هکر نیوز بالا رفت، جایی که ده ها نظر در مورد آنچه نتایج در مورد ظرفیت هوش مصنوعی برای اکتشافات علمی واقعی می گویند را به خود جلب کرد. For more context on this story, see our ongoing latest AI developments.
NanoGPT Speedrun در واقع چیست
این معیار از مخزن اصلاحشده nanogpt که توسط کلر جردن نگهداری میشود و فهرست بلندبالایی از مشارکتکنندگان انجمن میآید. بیان این چالش بسیار ساده است: با استفاده از 8 پردازنده گرافیکی NVIDIA H100، یک مدل زبانی را آموزش دهید که در مجموعه اعتبارسنجی FineWeb به 3.28 کاهش آنتروپی متقابل برسد - سطح عملکردی که تکرار GPT-2 اصلی Andrej Karpathy پس از 45 دقیقه به آن رسیده است - با حداکثر سرعت ممکن.
از طریق صدها مشارکت اجتماعی در دو سال گذشته، رکورد انسان به کمتر از 75 ثانیه و کمتر از 400 میلیون توکن آموزشی کاهش یافته است که بیش از 30 برابر نسبت به دستور اولیه بهبود یافته است. راهحلهای برنده مانند کاتالوگ مهندسی مدرن ML هستند: بهینهساز Muon، تعبیههای چرخشی با QK-Norm، فعالسازیهای مربعی ReLU، کمیسازی FP8 در توجه و پاسهای MLP، Flash Attention 3 با الگوهای پنجره کشویی، و دهها تکنیک دیگر که روی هم چیده شدهاند.
آزمایش Prime Intellect از مسیر بهینهساز معیار استفاده کرد، که - طبق مستندات مخزن - تعداد مراحل آموزشی مورد نیاز برای رسیدن به هدف را به حداقل میرساند، مشروط به معماری، مجموعه داده و اندازه دستهای ثابت، با بودجه ساعت دیواری نامحدود. این باعث می شود که به جای سرعت سخت افزار خام، آزمایشی خالص برای کشف الگوریتم باشد.
آزمایش چگونه کار کرد
به هر یک از 18 مدل به طور مستقل وظیفه داده شد: پیشنهاد تغییرات در دستورالعمل آموزشی، اجرای آزمایشها، بررسی نتایج، و تکرار - با یک اسکریپت تأیید ثابت و دانههای تصادفی ثابت که اطمینان حاصل میکند که بهبود ادعا شده واقعی است و نه یک اجرای خوش شانس. همانطور که یکی از کامنتگذاران هکر نیوز آن را خلاصه کرد، از مدلها خواسته شد تا در مورد چگونگی بهبود آموزش یک مدل کوچک تحقیق کنند، تغییرات را مکرر امتحان کنند، آنها را آزمایش کنند و از نتایج برای تصمیمگیری در مورد آنچه در مرحله بعد امتحان کنند استفاده کنند.
این مدلها از طریق انواع مهارکنندههای عامل - از جمله claude-code، کدکس OpenAI، kimi-code، grok-cli، qwen-code، و عامل اصلی Prime Intellect کار میکردند - و تیم مصرف توکن هر اجرا، تعداد آزمایشها، تماسهای ابزار و زمان سپری شده نماینده را ردیابی کرد. در مجموع، این آزمایش صدها میلیون توکن در هر مدل برتر و میلیاردها در سراسر شبکه کامل مصرف کرد.
The Leaderboard: Fable 5 Leads The Pack
نتیجه سرفصل: مدل شناسایی شده بهعنوان Fable 5، که از طریق مهار کلود-کد اجرا میشود، 81.7 درصد از شکاف بین دستور اولیه و رکورد انسانی را با بهترین نتیجه تأیید شده 2726 در متریک تابلوی امتیازات کاهش داد. رسیدن به آنجا 8.7 روز از زمان تجمعی نماینده، تقریباً 800 میلیون توکن، 811 آزمایش و حدود 3000 تماس ابزار طول کشید.
گروه تعقیب کننده توسط Opus 5 رهبری شد که 53.6 درصد از فاصله را پر کرد و پس از آن Kimi K3 با 52.2 درصد با مهار عامل اصلی Prime Intellect (و 45.8 درصد از طریق kimi-code) با 52.2 درصد در رده بعدی قرار گرفت. Opus 4.8 با 39.4 درصد، چندین نسخه GPT-5.6 بین 11 تا 36 درصد، Sonnet 5 26.8 درصد بسته شد و Grok 4.5 و Qwen3.8 Max هر کدام به حدود 24.6 درصد رسیدند.
پایین تر، DeepSeek V4 Pro 12.3 درصد از شکاف را کاهش داد، GPT-5.5 به 8.1 درصد رسید و Kimi K2.7 قدیمی تر با 7.2 درصد به پایان رسید. قابل ذکر است، یکی از مدلهایی که اخیراً منتشر شده است - GLM 5.3 - هنوز در زمان انتشار بدون هیچ سابقه معتبری در حال اجرا بود، یادآوری میکند که این معیار مدلهایی را که نمیتوانند به طور قابل اعتماد پیشرفتهای خود را تأیید کنند، مجازات میکند.
چرا مهم است
معیارها به این دلیل اهمیت دارند که چیزی را که تابلوهای امتیازدهی کدنویسی نمیتوانند اندازهگیری کنند: توانایی اجرای یک حلقه تحقیقاتی واقعی - فرضیه، آزمایش، تجزیه و تحلیل، بازبینی - در طول روز به جای چند دقیقه. این قابلیت پایه و اساس حوزه نوظهور تحقیقات هوش مصنوعی مستقل است، که در آن ماموران وظیفه دارند نه کدهایی را بنویسند تا مشخصات مشخص کنند، بلکه وظیفه دارند چیزهایی را که کسی به آنها نشان نداده است، کشف کنند.
گسترش نتایج به خودی خود آموزنده است. طبق نوشته پروژه، تقریباً هر مدل در آزمایش، همان ایدههای برنده اصلی را پیدا کرد - چیزی که بهترین اجراها را از هم جدا میکرد، چیزی بود که یک آزمایش پشت سر گذاشت: عوامل قویتر سیگنالهای ضعیف را در نتایج نویز به اندازه کافی برای اعتبارسنجی آنها حفظ کردند و دادههای آزمایشی خودشان را بهتر درک کردند.
هشدارهای انجمن
نظر دهندگان هکر نیوز نکات روش شناختی عادلانه ای را مطرح کردند. تنظیمات تلاش و مهارها در مدلها متفاوت بود - Fable 5 با تنظیمات استدلال بالا اجرا میشد در حالی که Opus 5 با حداکثر کار میکرد - و محاسبه 153 اجرا در 18 مدل نشان میدهد که برخی از مدلها تلاش بیشتری نسبت به بقیه داشتهاند. اینکه آیا رتبه یک مدل منعکس کننده توانایی تحقیق خام آن است یا کیفیت مهار آن یک سوال باز باقی می ماند.
با این حال، مسیر سفر مشخص است. زمانی که سریعترین دستهای انسان سالها تلاش جمعی کردند تا به رکورد فعلی دست یابند، بهترین عوامل خودمختار اکنون بیشتر این شکاف را در مدت زمان کمی بیش از یک هفته محاسبه میکنند. سوال بعدی - اینکه آیا هر مدلی می تواند 18.3 درصد باقیمانده را ببندد - ممکن است زودتر از حد انتظار پاسخ داده شود.
برای اطلاعات بیشتر در مورد معیارها و تحقیقاتی که مرزهای هوش مصنوعی را شکل می دهند، پوشش مداوم AI Buzz Wire را دنبال کنید.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →