محققان انویدیا سیستم عاملی ساخته اند که کلود اپوس 5 آنتروپیک را به امتیاز 100 درصدی در ARC-AGI-3، یکی از خواستارترین معیارهای استدلال تعاملی در هوش مصنوعی - با استفاده از همان مدلی که وقتی به تنهایی اجرا می شود، 30 درصد به دست می آورد. نتیجه که روز جمعه در وبلاگ فنی انویدیا منتشر شد، قوی‌ترین مدرکی است که نشان می‌دهد نرم‌افزاری که در اطراف یک مدل مرزی پیچیده شده است به اندازه خود مدل اهمیت دارد. برای هر کسی که [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) را ردیابی می‌کند، نشان‌دهنده تغییری در مکان واقعی مزیت رقابتی در هوش مصنوعی عامل است.

این سیستم AVO نامیده می‌شود که مخفف عبارت Agentic Variation Operators است و انویدیا معماری همه‌منظوره‌ای برای عامل‌های مستقل افق بلند دارد – هوش مصنوعی که می‌تواند ساعت‌ها یا روزها به جای پاسخ دادن به یک درخواست، در کار بماند. در مجموعه عمومی ARC-AGI-3، AVO امتیاز 100.00 RHAE را در تمام 25 محیط بازی ثبت کرد، و تمام 183 سطح را در 6624 اکشن محیطی با استفاده از Claude Opus 5 به عنوان مدل پشتیبان خود تکمیل کرد.

آنچه ARC-AGI-3 در واقع آزمایش می کند

ARC-AGI-3 یک معیار استدلال تعاملی است که توسط بنیاد جایزه ARC ایجاد شده است. یک عامل در محیط های ناآشنا و بازی مانند بدون دستورالعمل، بدون قوانین و هدف مشخص شده رها می شود. باید از طریق آزمون و خطا کاوش کند، استنباط کند که محیط چگونه کار می کند، بفهمد "برنده شدن" به چه معناست، و سپس به اندازه کافی کارآمد عمل کند تا در سطوح به تدریج سخت تر پیشرفت کند.

معیار امتیازدهی این معیار، کارایی نسبی اقدام انسانی (RHAE)، تکمیل کار را با تعداد کمی از اقداماتی که عامل نسبت به بازیکنانی که برای اولین بار در انسان حضور دارند، تلف می‌کند، ترکیب می‌کند. این آن را به یک آزمون بی‌رحمانه استقلال پایدار تبدیل می‌کند: عامل باید آموخته‌های خود را به خاطر بسپارد، از اشتباهات خود بازیابی کند و اقدامات خود را با دقت در طول یک دوره کامل بودجه بندی کند.

شماره سرفصل انویدیا از مقایسه به دست می آید. VISTA، مهار تعامل مستقیم قبلی که از Claude Opus 5 نیز استفاده می کرد، همان 183 سطح عمومی را در 7542 اقدام محیطی تکمیل کرد. طبق پست وبلاگ انویدیا، AVO تقریباً به 12٪ اقدامات کمتری برای تکمیل کار نیاز داشت.

از هسته های GPU تا بازی های ناشناخته

AVO برای پازل ساخته نشده است. انویدیا برای اولین بار معماری را در بهینه سازی هسته GPU نشان داد، دامنه ای که تغییرات کوچک کد می تواند صحت، رفتار حافظه و توان عملیاتی را به روش های غیرقابل پیش بینی از بین ببرد. در یک مطالعه هسته توجه، AVO به مدت هفت روز به طور مداوم اجرا شد، بیش از 500 جهت بهینه سازی را بررسی کرد و 40 نسخه هسته را متعهد شد. در سیستم‌های NVIDIA DGX B200، هسته‌های توجه چند سر به‌دست‌آمده تا 3.5 درصد از cuDNN و تا 10.5 درصد از FlashAttention-4 بهتر عمل کردند. عامل سپس هسته تکامل یافته خود را با توجه به پرسش های گروهی در حدود 30 دقیقه کار مستقل اضافی تطبیق داد.

همان حلقه اصلی - بازرسی، برنامه ریزی، پیاده سازی، آزمایش، ارزیابی - سپس به ARC-AGI-3 اشاره کرد و تنها رابط وظیفه تغییر کرد. دو مکانیسم منتقل شده است. اولین مورد حافظه پایدار است که پیاده سازی های قبلی، نتایج ارزیابی، خروجی های کامپایلر و پروفایلر و استدلال انباشته را ذخیره می کند، بنابراین عامل می تواند به جای بازسازی زمینه از ابتدا، از وضعیت فعلی خود بازگردد. دومی ناظر است، مامور دومی که مسیر کلی را زیر نظر دارد و زمانی که پیشرفت متوقف می شود مداخله می کند.

ناظر موفقیت است

TechCrunch که با عادل ال هالاک از انویدیا، معاون تولید در واحد هوش مصنوعی این شرکت مصاحبه کرد، سرپرست را به عنوان مهمترین عنصر برجسته کرد. ال هالاک به این نشریه گفت: «تقریباً مانند یک مدیر عامل عمل می‌کند که وقتی عامل را از مسیر خارج می‌کند یا شروع به کاوش در مسیری می‌کند که ممکن است به بن‌بست منتهی شود، یا مسیری را که قبلاً پیموده بود را دوباره بررسی می‌کند.»

شکاف عملکردی فاحش است. آزمایش Nvidia نشان داد که Claude Opus 5 بدون مهار پیچیده توانست امتیاز 30% را در ARC-AGI-3 کسب کند - بهترین نتیجه در بین مدل‌های آزمایش شده بدون آزمایش، اما به هیچ وجه نزدیک به اجرای کامل نیست. مدل‌های OpenAI امتیاز کمتر از 10 درصد را در این معیار کسب کرده‌اند و این شرکت تحقیقات خود را در ماه گذشته منتشر کرد که نشان می‌دهد تغییر تنها دو تنظیمات مهار امتیاز آن را سه برابر کرده است. هیچ پیکربندی فقط مدلی به 100 درصدی که AVO به دست آورد نزدیک نشده است.

قابل‌توجه، پیکربندی AVO فقط به صورت متنی اجرا می‌شد: هر مشاهده به‌عنوان یک شبکه متنی دقیق 64×64 ارائه شد، بدون هیچ تصویر یا نشانه تصویری به مدل ارسال شد. قدرت استدلال از حلقه اطراف مدل ناشی می شود، نه از ادراک چندوجهی.

چرا صنعت روی هارنس شرط بندی می کند

این یافته در میان موجی از شواهد نشان می‌دهد که زیرساخت عامل، نه قابلیت مدل خام، گلوگاه فعلی برای هوش مصنوعی مستقل است. Databricks در ماه ژوئیه تحقیقات محک زنی را منتشر کرد که نشان می دهد مهار به طور چشمگیری بر عملکرد و هزینه تأثیر می گذارد. علی قدسی، مدیرعامل Databricks به تک‌کرانچ گفت: «شما می‌توانید همان مدل اما مهارهای متفاوت را انتخاب کنید و در صورت استفاده از مهار نادرست، هزینه‌ی قابل‌توجهی دریافت خواهید کرد». "این خود می تواند دو برابر هزینه شما باشد."

ال هالاک استدلال گسترده تری انویدیا را از نظر باز بودن چارچوب بندی کرد. او گفت: "ما معتقدیم که داشتن یک پشته عامل باز - جایی که شما کنترل روی مهار، زیرساخت ها، در طول زمان اجرا دارید - چیزی است که برای پیشبرد اکوسیستم به جلو و ایمن لازم است." انویدیا دارای قطعات باز از فناوری مهار تحت نام تجاری NeMo خود است و تحقیقات AVO در مقاله ای در arXiv مستند شده است.

معیاری با تاریخچه

ARC-AGI-3 به نقطه اشتعال در رقابت آزمایشگاه مرزی تبدیل شده است. OpenAI قبلاً نتایج قوی را برای مدل GPT-5.6 Sol خود در این معیار ادعا کرده بود و تنظیمات ارزیابی مورد استفاده را مورد بررسی دقیق قرار می داد. نتیجه انویدیا به یک معنا از این بحث کنار می‌رود – ادعای مدل هوشمندتر نیست، فقط یک عامل مهندسی بهتر حول مدل موجود است.

پیام برای توسعه دهندگان و شرکت های سازنده محصولات نمایندگی مستقیم است: انتخاب مدل هنوز مهم است، اما طراحی سیستم اکنون تصمیم می گیرد که آیا یک مدل مرزی نتایج مرزی را ارائه می دهد یا خیر. همانطور که انویدیا می گوید، ارزیابی یک مدل با ارزیابی یک نماینده یکسان نیست - و جداول معیار سال 2026 به طور فزاینده ای به مهندسانی که داربست را می سازند پاداش می دهد.

از هوش مصنوعی جلوتر بمانید

معماری‌های عامل سریع‌تر از همیشه در حال حرکت هستند و شکاف بین یک مهار خوب و یک مهار بد اکنون در نقاط معیار و دلار واقعی اندازه‌گیری می‌شود. [AI Buzz Wire را دنبال کنید] (https://aibuzzwire.news) برای پوشش روزانه و تأیید شده توسط منبع از تحقیقات هوش مصنوعی، معیارها و راه اندازی محصول.

اخبار تحقیقات هوش مصنوعی را بیشتر بخوانید →