Firma penanda aras Analisis Buatan mengeluarkan versi 4.2 Indeks Kepintarannya pada 4 September 2026, kemas kini interim yang mengolah semula cara model AI sempadan diukur — dan, menurut papan pendahulu baharu, Anthropic's Claude Fable 5.1 memegang tempat teratas, dengan OpenAI GPT-6 Astra di tempat kedua selepas kelebihan empat mata Sol.6.

Kemas kini datang hanya lapan bulan selepas Indeks v4 dilancarkan pada bulan Januari, pemulihan pantas yang luar biasa yang dikaitkan dengan kadar keluaran sempadan baru-baru ini. "Dengan sempadan bergerak begitu pantas dalam beberapa minggu lalu, kami merasakan adalah penting untuk menyampaikan kemas kini interim segera untuk memastikan Indeks kami kekal relevan dan berguna seperti biasa," tulis syarikat itu dalam pengumumannya.

Kedudukan tajuk

Menurut keputusan yang diterbitkan, Anthropic's Claude Fable 5.1 mendahului Indeks, diikuti oleh OpenAI GPT-6 Astra, yang meningkat empat mata berbanding GPT-5.6 Sol. Meta berada di kedudukan sebagai makmal ketiga terkuat di papan pendahulu, diikuti oleh SpaceXAI, Moonshot/Kimi, Z.AI dan Google.

Anthropic dan OpenAI juga berkongsi gambaran kecekapan kos yang dikemas kini: kedua-dua syarikat, bersama-sama dengan Meta dan Z.AI, menduduki sempadan Pareto "Kos setiap Tugas" Indeks, bermakna tiada makmal lain pada masa ini menawarkan kecerdasan yang lebih baik untuk harga yang sama bagi setiap tugasan yang telah disiapkan.

Mengenai kecekapan token, Analisis Buatan mendapati GPT-6 Astra "lebih cekap token daripada hampir semua model lain berhampiran sempadan kecerdasan," dengan Claude Fable 5.1, Grok 4.5 dan Gemini 3.5 Flash-Lite duduk di kedua-dua hujung lengkung. Firma itu menyatakan dalam analisis rakan, bagaimanapun, bahawa penggunaan token Astra yang lebih rendah berbanding dengan harganya yang lebih tinggi — peringatan bahawa kecekapan mentah dan jumlah kos tidak selalu bergerak bersama.

Perkara yang berubah dalam v4.2

Perubahan struktur yang paling ketara ialah dorongan yang disengajakan terhadap permainan penanda aras. Empat puluh peratus daripada pemberat Indeks kini datang daripada set ujian peribadi yang disimpan — menggandakan bahagian dalam v4.1 — termasuk AA-Briefcase, AA-Omniscience dan penyelesaian untuk CritPt. Firma itu berkata angka itu akan meningkat lagi dalam Indeks v5.

Dua penilaian baharu menambat kemas kini:

  • AA-Briefcase, penanda aras kerja pengetahuan ejentik dalaman dengan set ujian tertutup peribadi. Model dinilai pada projek profesional berbilang minggu, masing-masing dengan banyak tugasan terpaut dan beribu-ribu fail sumber input, dan digredkan melalui gabungan pemarkahan rubrik dan perbandingan berpasangan meliputi kejayaan tugasan yang boleh disahkan, kualiti analisis dan kualiti persembahan.
  • GDP.pdf, dicipta oleh Surge AI, yang menguji penaakulan satu pusingan merentas dokumen profesional: 100 PDF merangkumi sepuluh domain, dengan bukti diedarkan di 4,592 halaman teks, jadual, carta dan nota kaki. Respons digredkan mengikut 1,275 kriteria atom yang dikarang pakar, dan tajuk All-pass Rate mengkreditkan tugas hanya apabila setiap kriteria dipenuhi.

Satu penanda aras yang telah lama wujud sedang dalam perjalanan keluar: GPQA Diamond, ujian penaakulan sains peringkat siswazah, telah dialih keluar kerana ia telah tepu dengan berkesan oleh model sempadan.

Firma itu juga menaik taraf infrastruktur penggredannya, mengeluarkan AA-LCR v1.1 dengan sistem penggredan baharu segera dan kunci jawapan yang diperbetulkan, melabuhkan semula skala Elo untuk GDPval-AA v2 dan AA-Briefcase supaya penarafan kekal stabil apabila model baharu tiba, dan mengeraskan kotak pasir penggredan SciCode supaya kod yang perlahan tetapi betul tidak lagi betul.

Perkara yang didedahkan oleh ujian baharu

Keputusan pada penilaian baharu menawarkan gambaran yang lebih terperinci tentang kedudukan makmal sempadan.

Pada AA-Briefcase, Anthropic's Claude Fable 5.1 dan Opus 5 mendahului, diikuti oleh OpenAI's GPT-6 Astra dan Meta's Muse Spark 1.3. GPT-6 Astra mendapat kira-kira 85 mata Elo di atas GPT-5.6 Sol pada penilaian yang sama — lonjakan yang ketara antara generasi OpenAI berturut-turut.

Pada GDP.pdf, gambar terbalik: OpenAI mendahului dengan GPT-6 Astra pada Kadar Lulus Semua 33.2%, diikuti oleh GPT-5.6 Sol pada 28.2% dan Claude Fable 5.1 pada 26.2%. Perbezaan ini mencadangkan sintesis dokumen panjang dalam konteks yang sangat besar kekal sebagai kekuatan relatif untuk model terbaharu OpenAI, walaupun model Anthropic mengetuai keseluruhan tugasan Indeks dan kerja agen.

Mengapa set ujian peribadi penting

Peralihan ke arah penilaian yang ditangguhkan mencerminkan masalah kredibiliti yang lebih luas dalam penanda aras AI. Memandangkan model telah menyerap lebih banyak data ujian awam, makmal dan pemerhati bebas semakin bimbang bahawa markah tajuk pada penanda aras yang terkenal mencerminkan hafalan atau latihan yang disasarkan dan bukannya keupayaan tulen. Dengan mengekalkan bahagian yang semakin meningkat dalam set ujiannya secara peribadi dan menimbangnya dengan lebih berat, Analisis Buatan cuba mengekalkan isyarat bahawa papan pendahulu awam telah kehilangan.

Firma itu berkata ia telah membina elemen Indeks v5 "selama berbulan-bulan" dan sengaja menahan kemas kini untuk memastikan Indeks stabil melalui gelombang pelancaran model utama baru-baru ini. Di sebalik keluaran interim v4.2, ia merancang lebih banyak kemas kini tambahan dalam masa terdekat apabila ia melengkapkan peralihan v5.

Bagi pembeli yang memilih antara model sempadan, pengambilan praktikal daripada v4.2 ialah bahagian atas pasaran kekal sebagai perlumbaan dua kuda antara Anthropic dan OpenAI, dengan Meta menutup jurang — dan bahawa penilaian yang direka untuk tahan terhadap permainan kini melakukan lebih banyak kerja kedudukan. Pengguna yang menjejaki keputusan pemilihan model boleh mengikuti perkembangan AI terkini apabila pelancaran v5 semakin hampir.

Kekal Mendahului AI

Kemas kini penanda aras seperti ini membentuk semula cara industri menilai kemajuan. Baca lebih banyak berita AI dan kekal mendahului setiap keluaran model.

Baca lebih banyak berita AI →