شرکت بنچمارک Artificial Analysis نسخه 4.2 از شاخص هوش خود را در 4 سپتامبر 2026 منتشر کرد، بهروزرسانی موقتی که نحوه اندازهگیری مدلهای هوش مصنوعی مرزی را مجدداً بررسی میکند - و طبق جدول امتیازات جدید، Claude Fable 5.1 شرکت Anthropic با GPT-6 GPT-6 در رتبه دوم بالاتر از Astra-5، رتبه اول را دارد.
این بهروزرسانی تنها هشت ماه پس از راهاندازی Index v4 در ژانویه ارائه شد، یک چرخش غیرمعمول سریع این شرکت به سرعت نسخههای مرزی اخیر نسبت داد. این شرکت در اطلاعیه خود نوشت: "با توجه به اینکه مرزها در هفته های گذشته به سرعت حرکت می کنند، ما احساس می کنیم مهم است که یک به روز رسانی موقت فوری ارائه دهیم تا اطمینان حاصل کنیم که شاخص ما مثل همیشه مرتبط و مفید باقی می ماند."
رتبه بندی سرفصل ها
طبق نتایج منتشر شده، Claude Fable 5.1 Anthropic در رتبه اول قرار دارد و پس از آن GPT-6 Astra از OpenAI قرار دارد که چهار امتیاز نسبت به GPT-5.6 Sol بهبود بخشیده است. متا به عنوان سومین آزمایشگاه قوی در جدول امتیازات و پس از آن SpaceXAI، Moonshot/Kimi، Z.AI و گوگل قرار دارد.
Anthropic و OpenAI نیز تصویر بهروزشدهی کارآمدی هزینه را به اشتراک میگذارند: این دو شرکت، همراه با Meta و Z.AI، مرز پارتو «هزینه به ازای هر وظیفه» ایندکس را اشغال میکنند، به این معنی که در حال حاضر هیچ آزمایشگاه دیگری اطلاعات کاملاً بهتری را با همان قیمت برای هر کار انجامشده ارائه نمیدهد.
در مورد کارایی توکن، تجزیه و تحلیل مصنوعی نشان داد که GPT-6 Astra تقریباً از هر مدل دیگری در نزدیکی مرزهای اطلاعاتی کارآمدتر است، با Claude Fable 5.1، Grok 4.5 و Gemini 3.5 Flash-Lite در دو انتهای منحنی قرار دارند. با این حال، این شرکت در یک تحلیل همراه خاطرنشان کرد که استفاده کمتر توکن Astra با قیمتهای بالاتر آن غلبه میکند - یادآور این است که راندمان خام و هزینه کل همیشه با هم حرکت نمیکنند.
چه چیزی در نسخه 4.2 تغییر کرد
مهمترین تغییر ساختاری، فشار عمدی علیه بازیهای معیار است. چهل درصد وزن شاخص اکنون از مجموعههای تست خصوصی و نگهداشتهشده - دو برابر سهم در نسخه 4.1 - از جمله AA-Briefcase، AA-Omniscience و راهحلهای CritPt میآید. این شرکت گفت که این رقم در Index v5 بیشتر خواهد شد.
دو ارزیابی جدید به روز رسانی را ثابت می کند:
- AA-Briefcase، معیار کار دانش نمایندگی داخلی با مجموعه تست خصوصی. مدلها در پروژههای حرفهای چند هفتهای، که هر کدام دارای وظایف مرتبط زیادی و هزاران فایل منبع ورودی هستند، ارزیابی میشوند و از طریق ترکیبی از امتیازدهی روبریک و مقایسه زوجی که موفقیت کار قابل تأیید، کیفیت تحلیلی و کیفیت ارائه را پوشش میدهد، درجهبندی میشوند.
- GDP.pdf، ایجاد شده توسط Surge AI، که استدلال تک چرخشی را در اسناد حرفه ای آزمایش می کند: 100 فایل PDF در ده دامنه، با شواهد توزیع شده در 4592 صفحه متن، جداول، نمودارها و پاورقی ها. پاسخها بر اساس 1275 معیار اتمی نوشته شده توسط متخصص درجهبندی میشوند و عنوان نرخ همه قبولی تنها زمانی یک وظیفه را اعتبار میدهد که هر معیاری برآورده شود.
یکی از معیارهای قدیمی در راه است: GPQA Diamond، آزمون استدلال علمی در سطح فارغ التحصیلان، حذف شده است، زیرا به طور موثر توسط مدل های مرزی اشباع شده است.
این شرکت همچنین زیرساختهای درجهبندی خود را ارتقا داد و AA-LCR نسخه 1.1 را با یک سیستم درجهبندی جدید، کلیدهای پاسخ سریع و اصلاحشده منتشر کرد، مقیاس Elo را برای GDPval-AA v2 و AA-Briefcase مجدداً لنگر انداخت تا رتبهبندیها با ورود مدلهای جدید ثابت بماند، و SciCode را سختتر کرد که بهعنوان جعبههای شن و ماسهای، درجهبندی را کاهش نمیدهد.
آنچه آزمایش های جدید نشان می دهد
نتایج ارزیابیهای جدید تصویری دقیقتر از مکان واقعی آزمایشگاههای مرزی ارائه میدهد.
در AA-Briefcase، Anthropic's Claude Fable 5.1 و Opus 5 پیشتاز هستند و پس از آن GPT-6 Astra از OpenAI و Muse Spark 1.3 متا قرار دارند. GPT-6 Astra در همان ارزیابی تقریباً 85 امتیاز Elo بالاتر از GPT-5.6 Sol کسب می کند - یک جهش قابل توجه بین نسل های متوالی OpenAI.
در GDP.pdf، تصویر تغییر میکند: OpenAI با GPT-6 Astra با 33.2% نرخ عبور، پیشتاز است، پس از آن GPT-5.6 Sol با 28.2% و Claude Fable 5.1 با 26.2%. این واگرایی نشان میدهد که ترکیب اسناد بلندمدت در زمینههای بسیار بزرگ، به عنوان یک نقطه قوت نسبی برای جدیدترین مدل OpenAI باقی میماند، حتی اگر مدلهای آنتروپیک وظایف کلی شاخص و کار نمایندگی را رهبری کنند.
چرا مجموعه های تست خصوصی مهم هستند
تغییر به سمت ارزیابی نگهداشتهشده نشاندهنده یک مشکل اعتبار گستردهتر در معیارسنجی هوش مصنوعی است. از آنجایی که مدلها دادههای آزمایش عمومی بیشتری را جذب کردهاند، آزمایشگاهها و ناظران مستقل به طور فزایندهای نگران این هستند که نمرات سرفصل در معیارهای شناختهشده منعکسکننده حفظ کردن یا آموزش هدفمند به جای قابلیت واقعی باشد. تجزیه و تحلیل مصنوعی با خصوصی نگه داشتن سهم فزاینده ای از مجموعه های آزمایشی خود و وزن دادن بیشتر به آنها، تلاش می کند سیگنالی را حفظ کند که تابلوهای امتیاز عمومی از دست داده اند.
این شرکت گفت که «ماهها» در حال ساخت عناصر Index v5 بوده است و عمداً بهروزرسانیها را متوقف کرده است تا ایندکس را در طول موج اخیر عرضههای مدلهای بزرگ ثابت نگه دارد. فراتر از نسخه موقت نسخه 4.2، بهروزرسانیهای افزایشی بیشتری را در آینده نزدیک با تکمیل انتقال نسخه 5 برنامهریزی میکند.
برای خریدارانی که بین مدلهای مرزی انتخاب میکنند، نکته عملی نسخه 4.2 این است که صدر بازار رقابتی دو اسبه بین Anthropic و OpenAI باقی میماند و متا فاصله را کم میکند – و ارزیابیهایی که برای مقاومت در برابر بازی طراحی شدهاند اکنون کار رتبهبندی بیشتری را انجام میدهند. کاربرانی که تصمیمات انتخاب مدل را ردیابی می کنند، می توانند با نزدیک شدن به عرضه نسخه 5، آخرین پیشرفت های هوش مصنوعی را دنبال کنند.
از هوش مصنوعی جلوتر بمانید
بهروزرسانیهای معیار مانند این، چگونگی پیشرفت صنعت را تغییر میدهند. [اخبار هوش مصنوعی را بیشتر بخوانید] (https://aibuzzwire.news) و از هر مدلی که عرضه می شود جلوتر باشید.
اخبار هوش مصنوعی را بیشتر بخوانید →