شرکت بنچمارک Artificial Analysis نسخه 4.2 از شاخص هوش خود را در 4 سپتامبر 2026 منتشر کرد، به‌روزرسانی موقتی که نحوه اندازه‌گیری مدل‌های هوش مصنوعی مرزی را مجدداً بررسی می‌کند - و طبق جدول امتیازات جدید، Claude Fable 5.1 شرکت Anthropic با GPT-6 GPT-6 در رتبه دوم بالاتر از Astra-5، رتبه اول را دارد.

این به‌روزرسانی تنها هشت ماه پس از راه‌اندازی Index v4 در ژانویه ارائه شد، یک چرخش غیرمعمول سریع این شرکت به سرعت نسخه‌های مرزی اخیر نسبت داد. این شرکت در اطلاعیه خود نوشت: "با توجه به اینکه مرزها در هفته های گذشته به سرعت حرکت می کنند، ما احساس می کنیم مهم است که یک به روز رسانی موقت فوری ارائه دهیم تا اطمینان حاصل کنیم که شاخص ما مثل همیشه مرتبط و مفید باقی می ماند."

رتبه بندی سرفصل ها

طبق نتایج منتشر شده، Claude Fable 5.1 Anthropic در رتبه اول قرار دارد و پس از آن GPT-6 Astra از OpenAI قرار دارد که چهار امتیاز نسبت به GPT-5.6 Sol بهبود بخشیده است. متا به عنوان سومین آزمایشگاه قوی در جدول امتیازات و پس از آن SpaceXAI، Moonshot/Kimi، Z.AI و گوگل قرار دارد.

Anthropic و OpenAI نیز تصویر به‌روزشده‌ی کارآمدی هزینه را به اشتراک می‌گذارند: این دو شرکت، همراه با Meta و Z.AI، مرز پارتو «هزینه به ازای هر وظیفه» ایندکس را اشغال می‌کنند، به این معنی که در حال حاضر هیچ آزمایشگاه دیگری اطلاعات کاملاً بهتری را با همان قیمت برای هر کار انجام‌شده ارائه نمی‌دهد.

در مورد کارایی توکن، تجزیه و تحلیل مصنوعی نشان داد که GPT-6 Astra تقریباً از هر مدل دیگری در نزدیکی مرزهای اطلاعاتی کارآمدتر است، با Claude Fable 5.1، Grok 4.5 و Gemini 3.5 Flash-Lite در دو انتهای منحنی قرار دارند. با این حال، این شرکت در یک تحلیل همراه خاطرنشان کرد که استفاده کمتر توکن Astra با قیمت‌های بالاتر آن غلبه می‌کند - یادآور این است که راندمان خام و هزینه کل همیشه با هم حرکت نمی‌کنند.

چه چیزی در نسخه 4.2 تغییر کرد

مهم‌ترین تغییر ساختاری، فشار عمدی علیه بازی‌های معیار است. چهل درصد وزن شاخص اکنون از مجموعه‌های تست خصوصی و نگه‌داشته‌شده - دو برابر سهم در نسخه 4.1 - از جمله AA-Briefcase، AA-Omniscience و راه‌حل‌های CritPt می‌آید. این شرکت گفت که این رقم در Index v5 بیشتر خواهد شد.

دو ارزیابی جدید به روز رسانی را ثابت می کند:

  • AA-Briefcase، معیار کار دانش نمایندگی داخلی با مجموعه تست خصوصی. مدل‌ها در پروژه‌های حرفه‌ای چند هفته‌ای، که هر کدام دارای وظایف مرتبط زیادی و هزاران فایل منبع ورودی هستند، ارزیابی می‌شوند و از طریق ترکیبی از امتیازدهی روبریک و مقایسه زوجی که موفقیت کار قابل تأیید، کیفیت تحلیلی و کیفیت ارائه را پوشش می‌دهد، درجه‌بندی می‌شوند.
  • GDP.pdf، ایجاد شده توسط Surge AI، که استدلال تک چرخشی را در اسناد حرفه ای آزمایش می کند: 100 فایل PDF در ده دامنه، با شواهد توزیع شده در 4592 صفحه متن، جداول، نمودارها و پاورقی ها. پاسخ‌ها بر اساس 1275 معیار اتمی نوشته شده توسط متخصص درجه‌بندی می‌شوند و عنوان نرخ همه قبولی تنها زمانی یک وظیفه را اعتبار می‌دهد که هر معیاری برآورده شود.

یکی از معیارهای قدیمی در راه است: GPQA Diamond، آزمون استدلال علمی در سطح فارغ التحصیلان، حذف شده است، زیرا به طور موثر توسط مدل های مرزی اشباع شده است.

این شرکت همچنین زیرساخت‌های درجه‌بندی خود را ارتقا داد و AA-LCR نسخه 1.1 را با یک سیستم درجه‌بندی جدید، کلیدهای پاسخ سریع و اصلاح‌شده منتشر کرد، مقیاس Elo را برای GDPval-AA v2 و AA-Briefcase مجدداً لنگر انداخت تا رتبه‌بندی‌ها با ورود مدل‌های جدید ثابت بماند، و SciCode را سخت‌تر کرد که به‌عنوان جعبه‌های شن و ماسه‌ای، درجه‌بندی را کاهش نمی‌دهد.

آنچه آزمایش های جدید نشان می دهد

نتایج ارزیابی‌های جدید تصویری دقیق‌تر از مکان واقعی آزمایشگاه‌های مرزی ارائه می‌دهد.

در AA-Briefcase، Anthropic's Claude Fable 5.1 و Opus 5 پیشتاز هستند و پس از آن GPT-6 Astra از OpenAI و Muse Spark 1.3 متا قرار دارند. GPT-6 Astra در همان ارزیابی تقریباً 85 امتیاز Elo بالاتر از GPT-5.6 Sol کسب می کند - یک جهش قابل توجه بین نسل های متوالی OpenAI.

در GDP.pdf، تصویر تغییر می‌کند: OpenAI با GPT-6 Astra با 33.2% نرخ عبور، پیشتاز است، پس از آن GPT-5.6 Sol با 28.2% و Claude Fable 5.1 با 26.2%. این واگرایی نشان می‌دهد که ترکیب اسناد بلندمدت در زمینه‌های بسیار بزرگ، به عنوان یک نقطه قوت نسبی برای جدیدترین مدل OpenAI باقی می‌ماند، حتی اگر مدل‌های آنتروپیک وظایف کلی شاخص و کار نمایندگی را رهبری کنند.

چرا مجموعه های تست خصوصی مهم هستند

تغییر به سمت ارزیابی نگه‌داشته‌شده نشان‌دهنده یک مشکل اعتبار گسترده‌تر در معیارسنجی هوش مصنوعی است. از آنجایی که مدل‌ها داده‌های آزمایش عمومی بیشتری را جذب کرده‌اند، آزمایشگاه‌ها و ناظران مستقل به طور فزاینده‌ای نگران این هستند که نمرات سرفصل در معیارهای شناخته‌شده منعکس‌کننده حفظ کردن یا آموزش هدفمند به جای قابلیت واقعی باشد. تجزیه و تحلیل مصنوعی با خصوصی نگه داشتن سهم فزاینده ای از مجموعه های آزمایشی خود و وزن دادن بیشتر به آنها، تلاش می کند سیگنالی را حفظ کند که تابلوهای امتیاز عمومی از دست داده اند.

این شرکت گفت که «ماه‌ها» در حال ساخت عناصر Index v5 بوده است و عمداً به‌روزرسانی‌ها را متوقف کرده است تا ایندکس را در طول موج اخیر عرضه‌های مدل‌های بزرگ ثابت نگه دارد. فراتر از نسخه موقت نسخه 4.2، به‌روزرسانی‌های افزایشی بیشتری را در آینده نزدیک با تکمیل انتقال نسخه 5 برنامه‌ریزی می‌کند.

برای خریدارانی که بین مدل‌های مرزی انتخاب می‌کنند، نکته عملی نسخه 4.2 این است که صدر بازار رقابتی دو اسبه بین Anthropic و OpenAI باقی می‌ماند و متا فاصله را کم می‌کند – و ارزیابی‌هایی که برای مقاومت در برابر بازی طراحی شده‌اند اکنون کار رتبه‌بندی بیشتری را انجام می‌دهند. کاربرانی که تصمیمات انتخاب مدل را ردیابی می کنند، می توانند با نزدیک شدن به عرضه نسخه 5، آخرین پیشرفت های هوش مصنوعی را دنبال کنند.

از هوش مصنوعی جلوتر بمانید

به‌روزرسانی‌های معیار مانند این، چگونگی پیشرفت صنعت را تغییر می‌دهند. [اخبار هوش مصنوعی را بیشتر بخوانید] (https://aibuzzwire.news) و از هر مدلی که عرضه می شود جلوتر باشید.

اخبار هوش مصنوعی را بیشتر بخوانید →