پس از اینکه Claude Opus 5 Anthropic بر معیار ARC-AGI-3 تسلط یافت، OpenAI عقب نشینی کرد و نتایجی را منتشر کرد که نشان می دهد مدل GPT-5.6 Sol خودش به 38.3 درصد رسیده است - به شرط اینکه از تنظیمات ترجیحی OpenAI به جای مهار تست رسمی استفاده کنید.
این مناقشه که در 30 ژوئیه 2026 رخ داد، به قلب یک مشکل رو به رشد در ارزیابی هوش مصنوعی می پردازد: معیارها دیگر فقط یک مدل را اندازه نمی گیرند، بلکه کل داربست فنی را که در اطراف آن پیچیده شده است. برای تحلیل عمیقتر [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) و نسخههای مدل، AI Buzz Wire داستان را دنبال میکند.
اعداد و گرفتن
OpenAI گزارش داد که GPT-5.6 Sol در ARC-AGI-3 به 38.3 درصد رسیده است و از کلود اپوس 5 Anthropic که پس از چهار برابر کردن رکورد بنچمارک، 30.2 درصد را کسب کرده است، پیشی گرفته است. اخطار قابل توجه است: این رقم 38.3 درصد به دو ویژگی خاص OpenAI's Responses API بستگی دارد.
اولین مورد استدلال حفظ شده است که زنجیره فکری مدل را بین مراحل حفظ می کند تا اینکه بعد از هر عمل آن را کنار بگذارد. مورد دوم تراکم است که به جای کوتاه کردن بافت قدیمیتر، آن را خلاصه میکند و به مدل اجازه میدهد تا بدون از دست دادن استدلال قبلی، روی مسائل طولانی کار کند.
از طریق مهار استاندارد رسمی جایزه ARC - که عمداً از تنظیمات خاص ارائه دهنده برای اطمینان از مقایسه سیب به سیب جلوگیری می کند - GPT-5.6 Sol تنها 7.8 درصد را مدیریت کرد. OpenAI استدلال میکند که دلیل آن این است که راهاندازی رسمی پس از هر مرحله، استدلال مدل را کنار میگذارد، و عملکرد در کارهایی را که نیاز به تفکر چند مرحلهای پایدار دارند، کاهش میدهد.
معیاری که برای خلوص ساخته شده است
ARC-AGI-3 توسط François Chollet و تیم جایزه ARC طراحی شد تا توانایی یک مدل را در حل معماهای استدلالی جدید که قبلاً هرگز ندیده بود بررسی کند - آزمونی برای هوش عمومی به جای دانش حفظ شده. برای حفظ منصفانه مقایسه ها، مهار رسمی عمداً ویژگی های خاص ارائه دهنده را از بین می برد و قابلیت مدل خام را در یک محیط خنثی اندازه گیری می کند.
استدلال مخالف OpenAI این است که این بی طرفی می تواند به یک نقص تبدیل شود. این شرکت ادعا میکند که مهار رسمی به یک "API تکمیلی به سبک OpenAI" قدیمیتر متکی بود که فاقد قابلیتهایی بود که Claude API قبلاً ارائه کرده بود و عملاً OpenAI را در مقایسه با Anthropic در یک نقطه ضعف ساختاری قرار میداد.
در اصل، OpenAI میگوید: شما مدل ما را با یک دست که از پشت بسته بودید اندازهگیری کردید.
پاسخ Chollet
فرانسوا شولت، یکی از بنیانگذاران جایزه ARC، با ترسیم یک خط مشخص بین دو نوع تنظیم تست پاسخ داد. او گفت که مهارهای "ساختار سفارشی برای حل معیار یا حاوی دانش در مورد قالب معیار" ممنوع هستند. اما تنظیمات API همه منظوره "که برای ARC-AGI-3 توسعه نیافته اند و برای همه کاربران API در دسترس هستند" یک بازی منصفانه است.
در واقع، Chollet پذیرفت که امتیاز GPT-5.6 Sol خود جایزه ARC، OpenAI را در نقطه ضعف قرار داده است. او خاطرنشان کرد که این سازمان «درباره نحوه بهترین آزمایش مدلهای خود، بهویژه در مورد تراکم، با OpenAI صحبتهای زیادی داشته است» و از شرکت «شروع به یافتن پاسخ» استقبال کرد.
Chollet یکی از نگرانی های باقی مانده را نشان داد. ارائه دهندگان مختلف با استفاده از تنظیمات مختلف چیزی را ایجاد می کنند که او آن را "مسئله برابری بالقوه" می نامد - اما او آن را قابل قبول می داند "تا زمانی که تنظیمات و هزینه به وضوح گزارش شود."
چرا این فراتر از تابلوی امتیازات مهم است
این اپیزود بر تنشی تاکید دارد که در حال تغییر نحوه ارزیابی پیشرفت صنعت هوش مصنوعی است. از آنجایی که مدلها بهطور فزایندهای از طریق APIهای غنی از ویژگیها به جای سیستمهای مستقل استفاده میشوند، مرز بین توانایی ذاتی یک مدل و مهندسی پیرامون آن همچنان محو میشود. معیاری که داربست را نادیده میگیرد ممکن است عملکرد دنیای واقعی را کمرنگ کند. کسی که از آن استقبال می کند ممکن است به شرکت ها برای انجام این آزمون پاداش دهد.
بعید است که بحث ARC-AGI-3 آخرین مورد باشد. از آنجایی که مدلهای مرزی نزدیک به بالای معیارهای تعیینشده قرار میگیرند، اختلاف نظر در مورد اینکه چه چیزی به عنوان یک اندازهگیری منصفانه به حساب میآید - و مهار آن که استاندارد را تعیین میکند - فقط تشدید میشود.
از هوش مصنوعی جلوتر بمانید
آیا میخواهید [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) را در مورد مدلها، معیارها و آزمایشگاههایی که آنها را میسازند دنبال کنید؟ AI Buzz Wire شما را تحت پوشش قرار داده است.
اخبار هوش مصنوعی را بیشتر بخوانید