محققان انویدیا سیستم عاملی ساخته اند که کلود اپوس 5 آنتروپیک را به امتیاز 100 درصدی در ARC-AGI-3، یکی از خواستارترین معیارهای استدلال تعاملی در هوش مصنوعی - با استفاده از همان مدلی که وقتی به تنهایی اجرا می شود، 30 درصد به دست می آورد. نتیجه که روز جمعه در وبلاگ فنی انویدیا منتشر شد، قویترین مدرکی است که نشان میدهد نرمافزاری که در اطراف یک مدل مرزی پیچیده شده است به اندازه خود مدل اهمیت دارد. برای هر کسی که [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) را ردیابی میکند، نشاندهنده تغییری در مکان واقعی مزیت رقابتی در هوش مصنوعی عامل است.
این سیستم AVO نامیده میشود که مخفف عبارت Agentic Variation Operators است و انویدیا معماری همهمنظورهای برای عاملهای مستقل افق بلند دارد – هوش مصنوعی که میتواند ساعتها یا روزها به جای پاسخ دادن به یک درخواست، در کار بماند. در مجموعه عمومی ARC-AGI-3، AVO امتیاز 100.00 RHAE را در تمام 25 محیط بازی ثبت کرد، و تمام 183 سطح را در 6624 اکشن محیطی با استفاده از Claude Opus 5 به عنوان مدل پشتیبان خود تکمیل کرد.
آنچه ARC-AGI-3 در واقع آزمایش می کند
ARC-AGI-3 یک معیار استدلال تعاملی است که توسط بنیاد جایزه ARC ایجاد شده است. یک عامل در محیط های ناآشنا و بازی مانند بدون دستورالعمل، بدون قوانین و هدف مشخص شده رها می شود. باید از طریق آزمون و خطا کاوش کند، استنباط کند که محیط چگونه کار می کند، بفهمد "برنده شدن" به چه معناست، و سپس به اندازه کافی کارآمد عمل کند تا در سطوح به تدریج سخت تر پیشرفت کند.
معیار امتیازدهی این معیار، کارایی نسبی اقدام انسانی (RHAE)، تکمیل کار را با تعداد کمی از اقداماتی که عامل نسبت به بازیکنانی که برای اولین بار در انسان حضور دارند، تلف میکند، ترکیب میکند. این آن را به یک آزمون بیرحمانه استقلال پایدار تبدیل میکند: عامل باید آموختههای خود را به خاطر بسپارد، از اشتباهات خود بازیابی کند و اقدامات خود را با دقت در طول یک دوره کامل بودجه بندی کند.
شماره سرفصل انویدیا از مقایسه به دست می آید. VISTA، مهار تعامل مستقیم قبلی که از Claude Opus 5 نیز استفاده می کرد، همان 183 سطح عمومی را در 7542 اقدام محیطی تکمیل کرد. طبق پست وبلاگ انویدیا، AVO تقریباً به 12٪ اقدامات کمتری برای تکمیل کار نیاز داشت.
از هسته های GPU تا بازی های ناشناخته
AVO برای پازل ساخته نشده است. انویدیا برای اولین بار معماری را در بهینه سازی هسته GPU نشان داد، دامنه ای که تغییرات کوچک کد می تواند صحت، رفتار حافظه و توان عملیاتی را به روش های غیرقابل پیش بینی از بین ببرد. در یک مطالعه هسته توجه، AVO به مدت هفت روز به طور مداوم اجرا شد، بیش از 500 جهت بهینه سازی را بررسی کرد و 40 نسخه هسته را متعهد شد. در سیستمهای NVIDIA DGX B200، هستههای توجه چند سر بهدستآمده تا 3.5 درصد از cuDNN و تا 10.5 درصد از FlashAttention-4 بهتر عمل کردند. عامل سپس هسته تکامل یافته خود را با توجه به پرسش های گروهی در حدود 30 دقیقه کار مستقل اضافی تطبیق داد.
همان حلقه اصلی - بازرسی، برنامه ریزی، پیاده سازی، آزمایش، ارزیابی - سپس به ARC-AGI-3 اشاره کرد و تنها رابط وظیفه تغییر کرد. دو مکانیسم منتقل شده است. اولین مورد حافظه پایدار است که پیاده سازی های قبلی، نتایج ارزیابی، خروجی های کامپایلر و پروفایلر و استدلال انباشته را ذخیره می کند، بنابراین عامل می تواند به جای بازسازی زمینه از ابتدا، از وضعیت فعلی خود بازگردد. دومی ناظر است، مامور دومی که مسیر کلی را زیر نظر دارد و زمانی که پیشرفت متوقف می شود مداخله می کند.
ناظر موفقیت است
TechCrunch که با عادل ال هالاک از انویدیا، معاون تولید در واحد هوش مصنوعی این شرکت مصاحبه کرد، سرپرست را به عنوان مهمترین عنصر برجسته کرد. ال هالاک به این نشریه گفت: «تقریباً مانند یک مدیر عامل عمل میکند که وقتی عامل را از مسیر خارج میکند یا شروع به کاوش در مسیری میکند که ممکن است به بنبست منتهی شود، یا مسیری را که قبلاً پیموده بود را دوباره بررسی میکند.»
شکاف عملکردی فاحش است. آزمایش Nvidia نشان داد که Claude Opus 5 بدون مهار پیچیده توانست امتیاز 30% را در ARC-AGI-3 کسب کند - بهترین نتیجه در بین مدلهای آزمایش شده بدون آزمایش، اما به هیچ وجه نزدیک به اجرای کامل نیست. مدلهای OpenAI امتیاز کمتر از 10 درصد را در این معیار کسب کردهاند و این شرکت تحقیقات خود را در ماه گذشته منتشر کرد که نشان میدهد تغییر تنها دو تنظیمات مهار امتیاز آن را سه برابر کرده است. هیچ پیکربندی فقط مدلی به 100 درصدی که AVO به دست آورد نزدیک نشده است.
قابلتوجه، پیکربندی AVO فقط به صورت متنی اجرا میشد: هر مشاهده بهعنوان یک شبکه متنی دقیق 64×64 ارائه شد، بدون هیچ تصویر یا نشانه تصویری به مدل ارسال شد. قدرت استدلال از حلقه اطراف مدل ناشی می شود، نه از ادراک چندوجهی.
چرا صنعت روی هارنس شرط بندی می کند
این یافته در میان موجی از شواهد نشان میدهد که زیرساخت عامل، نه قابلیت مدل خام، گلوگاه فعلی برای هوش مصنوعی مستقل است. Databricks در ماه ژوئیه تحقیقات محک زنی را منتشر کرد که نشان می دهد مهار به طور چشمگیری بر عملکرد و هزینه تأثیر می گذارد. علی قدسی، مدیرعامل Databricks به تککرانچ گفت: «شما میتوانید همان مدل اما مهارهای متفاوت را انتخاب کنید و در صورت استفاده از مهار نادرست، هزینهی قابلتوجهی دریافت خواهید کرد». "این خود می تواند دو برابر هزینه شما باشد."
ال هالاک استدلال گسترده تری انویدیا را از نظر باز بودن چارچوب بندی کرد. او گفت: "ما معتقدیم که داشتن یک پشته عامل باز - جایی که شما کنترل روی مهار، زیرساخت ها، در طول زمان اجرا دارید - چیزی است که برای پیشبرد اکوسیستم به جلو و ایمن لازم است." انویدیا دارای قطعات باز از فناوری مهار تحت نام تجاری NeMo خود است و تحقیقات AVO در مقاله ای در arXiv مستند شده است.
معیاری با تاریخچه
ARC-AGI-3 به نقطه اشتعال در رقابت آزمایشگاه مرزی تبدیل شده است. OpenAI قبلاً نتایج قوی را برای مدل GPT-5.6 Sol خود در این معیار ادعا کرده بود و تنظیمات ارزیابی مورد استفاده را مورد بررسی دقیق قرار می داد. نتیجه انویدیا به یک معنا از این بحث کنار میرود – ادعای مدل هوشمندتر نیست، فقط یک عامل مهندسی بهتر حول مدل موجود است.
پیام برای توسعه دهندگان و شرکت های سازنده محصولات نمایندگی مستقیم است: انتخاب مدل هنوز مهم است، اما طراحی سیستم اکنون تصمیم می گیرد که آیا یک مدل مرزی نتایج مرزی را ارائه می دهد یا خیر. همانطور که انویدیا می گوید، ارزیابی یک مدل با ارزیابی یک نماینده یکسان نیست - و جداول معیار سال 2026 به طور فزاینده ای به مهندسانی که داربست را می سازند پاداش می دهد.
از هوش مصنوعی جلوتر بمانید
معماریهای عامل سریعتر از همیشه در حال حرکت هستند و شکاف بین یک مهار خوب و یک مهار بد اکنون در نقاط معیار و دلار واقعی اندازهگیری میشود. [AI Buzz Wire را دنبال کنید] (https://aibuzzwire.news) برای پوشش روزانه و تأیید شده توسط منبع از تحقیقات هوش مصنوعی، معیارها و راه اندازی محصول.
اخبار تحقیقات هوش مصنوعی را بیشتر بخوانید →