پس از اینکه Claude Opus 5 Anthropic بر معیار ARC-AGI-3 تسلط یافت، OpenAI عقب نشینی کرد و نتایجی را منتشر کرد که نشان می دهد مدل GPT-5.6 Sol خودش به 38.3 درصد رسیده است - به شرط اینکه از تنظیمات ترجیحی OpenAI به جای مهار تست رسمی استفاده کنید.

این مناقشه که در 30 ژوئیه 2026 رخ داد، به قلب یک مشکل رو به رشد در ارزیابی هوش مصنوعی می پردازد: معیارها دیگر فقط یک مدل را اندازه نمی گیرند، بلکه کل داربست فنی را که در اطراف آن پیچیده شده است. برای تحلیل عمیق‌تر [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) و نسخه‌های مدل، AI Buzz Wire داستان را دنبال می‌کند.

اعداد و گرفتن

OpenAI گزارش داد که GPT-5.6 Sol در ARC-AGI-3 به 38.3 درصد رسیده است و از کلود اپوس 5 Anthropic که پس از چهار برابر کردن رکورد بنچمارک، 30.2 درصد را کسب کرده است، پیشی گرفته است. اخطار قابل توجه است: این رقم 38.3 درصد به دو ویژگی خاص OpenAI's Responses API بستگی دارد.

اولین مورد استدلال حفظ شده است که زنجیره فکری مدل را بین مراحل حفظ می کند تا اینکه بعد از هر عمل آن را کنار بگذارد. مورد دوم تراکم است که به جای کوتاه کردن بافت قدیمی‌تر، آن را خلاصه می‌کند و به مدل اجازه می‌دهد تا بدون از دست دادن استدلال قبلی، روی مسائل طولانی کار کند.

از طریق مهار استاندارد رسمی جایزه ARC - که عمداً از تنظیمات خاص ارائه دهنده برای اطمینان از مقایسه سیب به سیب جلوگیری می کند - GPT-5.6 Sol تنها 7.8 درصد را مدیریت کرد. OpenAI استدلال می‌کند که دلیل آن این است که راه‌اندازی رسمی پس از هر مرحله، استدلال مدل را کنار می‌گذارد، و عملکرد در کارهایی را که نیاز به تفکر چند مرحله‌ای پایدار دارند، کاهش می‌دهد.

معیاری که برای خلوص ساخته شده است

ARC-AGI-3 توسط François Chollet و تیم جایزه ARC طراحی شد تا توانایی یک مدل را در حل معماهای استدلالی جدید که قبلاً هرگز ندیده بود بررسی کند - آزمونی برای هوش عمومی به جای دانش حفظ شده. برای حفظ منصفانه مقایسه ها، مهار رسمی عمداً ویژگی های خاص ارائه دهنده را از بین می برد و قابلیت مدل خام را در یک محیط خنثی اندازه گیری می کند.

استدلال مخالف OpenAI این است که این بی طرفی می تواند به یک نقص تبدیل شود. این شرکت ادعا می‌کند که مهار رسمی به یک "API تکمیلی به سبک OpenAI" قدیمی‌تر متکی بود که فاقد قابلیت‌هایی بود که Claude API قبلاً ارائه کرده بود و عملاً OpenAI را در مقایسه با Anthropic در یک نقطه ضعف ساختاری قرار می‌داد.

در اصل، OpenAI می‌گوید: شما مدل ما را با یک دست که از پشت بسته بودید اندازه‌گیری کردید.

پاسخ Chollet

فرانسوا شولت، یکی از بنیانگذاران جایزه ARC، با ترسیم یک خط مشخص بین دو نوع تنظیم تست پاسخ داد. او گفت که مهارهای "ساختار سفارشی برای حل معیار یا حاوی دانش در مورد قالب معیار" ممنوع هستند. اما تنظیمات API همه منظوره "که برای ARC-AGI-3 توسعه نیافته اند و برای همه کاربران API در دسترس هستند" یک بازی منصفانه است.

در واقع، Chollet پذیرفت که امتیاز GPT-5.6 Sol خود جایزه ARC، OpenAI را در نقطه ضعف قرار داده است. او خاطرنشان کرد که این سازمان «درباره نحوه بهترین آزمایش مدل‌های خود، به‌ویژه در مورد تراکم، با OpenAI صحبت‌های زیادی داشته است» و از شرکت «شروع به یافتن پاسخ» استقبال کرد.

Chollet یکی از نگرانی های باقی مانده را نشان داد. ارائه دهندگان مختلف با استفاده از تنظیمات مختلف چیزی را ایجاد می کنند که او آن را "مسئله برابری بالقوه" می نامد - اما او آن را قابل قبول می داند "تا زمانی که تنظیمات و هزینه به وضوح گزارش شود."

چرا این فراتر از تابلوی امتیازات مهم است

این اپیزود بر تنشی تاکید دارد که در حال تغییر نحوه ارزیابی پیشرفت صنعت هوش مصنوعی است. از آنجایی که مدل‌ها به‌طور فزاینده‌ای از طریق APIهای غنی از ویژگی‌ها به جای سیستم‌های مستقل استفاده می‌شوند، مرز بین توانایی ذاتی یک مدل و مهندسی پیرامون آن همچنان محو می‌شود. معیاری که داربست را نادیده می‌گیرد ممکن است عملکرد دنیای واقعی را کم‌رنگ کند. کسی که از آن استقبال می کند ممکن است به شرکت ها برای انجام این آزمون پاداش دهد.

بعید است که بحث ARC-AGI-3 آخرین مورد باشد. از آنجایی که مدل‌های مرزی نزدیک به بالای معیارهای تعیین‌شده قرار می‌گیرند، اختلاف نظر در مورد اینکه چه چیزی به عنوان یک اندازه‌گیری منصفانه به حساب می‌آید - و مهار آن که استاندارد را تعیین می‌کند - فقط تشدید می‌شود.

از هوش مصنوعی جلوتر بمانید

آیا می‌خواهید [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) را در مورد مدل‌ها، معیارها و آزمایشگاه‌هایی که آنها را می‌سازند دنبال کنید؟ AI Buzz Wire شما را تحت پوشش قرار داده است.

اخبار هوش مصنوعی را بیشتر بخوانید