آزمایشگاه غیرمتمرکز هوش مصنوعی Prime Intellect نتایج آزمایشی در مقیاس بزرگ را منتشر کرده است که آزمایش می‌کند مدل‌های هوش مصنوعی امروزی چقدر می‌توانند تحقیقات یادگیری ماشینی مستقل را انجام دهند - و بهترین آنها به طور قابل‌توجهی به تطابق با رکورد جهانی انسان در یک معیار مشهور جامعه نزدیک شده‌اند.

این پروژه که NanoGPT Speedrun Frontier نامیده شد و در 22 آگوست منتشر شد، شامل 153 اجرا مستقل در 18 مدل مرزی بود که سعی در سرعت اجرای بهینه ساز nanoGPT داشتند - رقابتی که در آن محققان به دنبال کارآمدترین راه برای آموزش یک مدل زبان کوچک با هدف کیفیت ثابت هستند. این داستان به سرعت در صفحه اول هکر نیوز بالا رفت، جایی که ده ها نظر در مورد آنچه نتایج در مورد ظرفیت هوش مصنوعی برای اکتشافات علمی واقعی می گویند را به خود جلب کرد. For more context on this story, see our ongoing latest AI developments.

NanoGPT Speedrun در واقع چیست

این معیار از مخزن اصلاح‌شده nanogpt که توسط کلر جردن نگهداری می‌شود و فهرست بلندبالایی از مشارکت‌کنندگان انجمن می‌آید. بیان این چالش بسیار ساده است: با استفاده از 8 پردازنده گرافیکی NVIDIA H100، یک مدل زبانی را آموزش دهید که در مجموعه اعتبارسنجی FineWeb به 3.28 کاهش آنتروپی متقابل برسد - سطح عملکردی که تکرار GPT-2 اصلی Andrej Karpathy پس از 45 دقیقه به آن رسیده است - با حداکثر سرعت ممکن.

از طریق صدها مشارکت اجتماعی در دو سال گذشته، رکورد انسان به کمتر از 75 ثانیه و کمتر از 400 میلیون توکن آموزشی کاهش یافته است که بیش از 30 برابر نسبت به دستور اولیه بهبود یافته است. راه‌حل‌های برنده مانند کاتالوگ مهندسی مدرن ML هستند: بهینه‌ساز Muon، تعبیه‌های چرخشی با QK-Norm، فعال‌سازی‌های مربعی ReLU، کمی‌سازی FP8 در توجه و پاس‌های MLP، Flash Attention 3 با الگوهای پنجره کشویی، و ده‌ها تکنیک دیگر که روی هم چیده شده‌اند.

آزمایش Prime Intellect از مسیر بهینه‌ساز معیار استفاده کرد، که - طبق مستندات مخزن - تعداد مراحل آموزشی مورد نیاز برای رسیدن به هدف را به حداقل می‌رساند، مشروط به معماری، مجموعه داده و اندازه دسته‌ای ثابت، با بودجه ساعت دیواری نامحدود. این باعث می شود که به جای سرعت سخت افزار خام، آزمایشی خالص برای کشف الگوریتم باشد.

آزمایش چگونه کار کرد

به هر یک از 18 مدل به طور مستقل وظیفه داده شد: پیشنهاد تغییرات در دستورالعمل آموزشی، اجرای آزمایش‌ها، بررسی نتایج، و تکرار - با یک اسکریپت تأیید ثابت و دانه‌های تصادفی ثابت که اطمینان حاصل می‌کند که بهبود ادعا شده واقعی است و نه یک اجرای خوش شانس. همانطور که یکی از کامنت‌گذاران هکر نیوز آن را خلاصه کرد، از مدل‌ها خواسته شد تا در مورد چگونگی بهبود آموزش یک مدل کوچک تحقیق کنند، تغییرات را مکرر امتحان کنند، آنها را آزمایش کنند و از نتایج برای تصمیم‌گیری در مورد آنچه در مرحله بعد امتحان کنند استفاده کنند.

این مدل‌ها از طریق انواع مهارکننده‌های عامل - از جمله claude-code، کدکس OpenAI، kimi-code، grok-cli، qwen-code، و عامل اصلی Prime Intellect کار می‌کردند - و تیم مصرف توکن هر اجرا، تعداد آزمایش‌ها، تماس‌های ابزار و زمان سپری شده نماینده را ردیابی کرد. در مجموع، این آزمایش صدها میلیون توکن در هر مدل برتر و میلیاردها در سراسر شبکه کامل مصرف کرد.

The Leaderboard: Fable 5 Leads The Pack

نتیجه سرفصل: مدل شناسایی شده به‌عنوان Fable 5، که از طریق مهار کلود-کد اجرا می‌شود، 81.7 درصد از شکاف بین دستور اولیه و رکورد انسانی را با بهترین نتیجه تأیید شده 2726 در متریک تابلوی امتیازات کاهش داد. رسیدن به آنجا 8.7 روز از زمان تجمعی نماینده، تقریباً 800 میلیون توکن، 811 آزمایش و حدود 3000 تماس ابزار طول کشید.

گروه تعقیب کننده توسط Opus 5 رهبری شد که 53.6 درصد از فاصله را پر کرد و پس از آن Kimi K3 با 52.2 درصد با مهار عامل اصلی Prime Intellect (و 45.8 درصد از طریق kimi-code) با 52.2 درصد در رده بعدی قرار گرفت. Opus 4.8 با 39.4 درصد، چندین نسخه GPT-5.6 بین 11 تا 36 درصد، Sonnet 5 26.8 درصد بسته شد و Grok 4.5 و Qwen3.8 Max هر کدام به حدود 24.6 درصد رسیدند.

پایین تر، DeepSeek V4 Pro 12.3 درصد از شکاف را کاهش داد، GPT-5.5 به 8.1 درصد رسید و Kimi K2.7 قدیمی تر با 7.2 درصد به پایان رسید. قابل ذکر است، یکی از مدل‌هایی که اخیراً منتشر شده است - GLM 5.3 - هنوز در زمان انتشار بدون هیچ سابقه معتبری در حال اجرا بود، یادآوری می‌کند که این معیار مدل‌هایی را که نمی‌توانند به طور قابل اعتماد پیشرفت‌های خود را تأیید کنند، مجازات می‌کند.

چرا مهم است

معیارها به این دلیل اهمیت دارند که چیزی را که تابلوهای امتیازدهی کدنویسی نمی‌توانند اندازه‌گیری کنند: توانایی اجرای یک حلقه تحقیقاتی واقعی - فرضیه، آزمایش، تجزیه و تحلیل، بازبینی - در طول روز به جای چند دقیقه. این قابلیت پایه و اساس حوزه نوظهور تحقیقات هوش مصنوعی مستقل است، که در آن ماموران وظیفه دارند نه کدهایی را بنویسند تا مشخصات مشخص کنند، بلکه وظیفه دارند چیزهایی را که کسی به آنها نشان نداده است، کشف کنند.

گسترش نتایج به خودی خود آموزنده است. طبق نوشته پروژه، تقریباً هر مدل در آزمایش، همان ایده‌های برنده اصلی را پیدا کرد - چیزی که بهترین اجراها را از هم جدا می‌کرد، چیزی بود که یک آزمایش پشت سر گذاشت: عوامل قوی‌تر سیگنال‌های ضعیف را در نتایج نویز به اندازه کافی برای اعتبارسنجی آنها حفظ کردند و داده‌های آزمایشی خودشان را بهتر درک کردند.

هشدارهای انجمن

نظر دهندگان هکر نیوز نکات روش شناختی عادلانه ای را مطرح کردند. تنظیمات تلاش و مهارها در مدل‌ها متفاوت بود - Fable 5 با تنظیمات استدلال بالا اجرا می‌شد در حالی که Opus 5 با حداکثر کار می‌کرد - و محاسبه 153 اجرا در 18 مدل نشان می‌دهد که برخی از مدل‌ها تلاش بیشتری نسبت به بقیه داشته‌اند. اینکه آیا رتبه یک مدل منعکس کننده توانایی تحقیق خام آن است یا کیفیت مهار آن یک سوال باز باقی می ماند.

با این حال، مسیر سفر مشخص است. زمانی که سریع‌ترین دست‌های انسان سال‌ها تلاش جمعی کردند تا به رکورد فعلی دست یابند، بهترین عوامل خودمختار اکنون بیشتر این شکاف را در مدت زمان کمی بیش از یک هفته محاسبه می‌کنند. سوال بعدی - اینکه آیا هر مدلی می تواند 18.3 درصد باقیمانده را ببندد - ممکن است زودتر از حد انتظار پاسخ داده شود.

برای اطلاعات بیشتر در مورد معیارها و تحقیقاتی که مرزهای هوش مصنوعی را شکل می دهند، پوشش مداوم AI Buzz Wire را دنبال کنید.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →