Perusahaan benchmarking Artificial Analysis ngrilis versi 4.2 saka Indeks Intelijen tanggal 4 September 2026, nganyari interim sing ngolah maneh carane model AI wates diukur - lan, miturut papan peringkat anyar, Anthropic's Claude Fable 5.1 nyekel posisi paling dhuwur, kanthi OpenAI GPT-6 Astra ing posisi kaping pindho sawise GPT 5-point.
Nganyari kasebut mung wolung wulan sawise Index v4 diluncurake ing wulan Januari, owah-owahan cepet banget saka atribut perusahaan kasebut kanthi cepet saka rilis perbatasan anyar. "Kanthi wates obah kanthi cepet ing sawetara minggu kepungkur, kita rumangsa penting kanggo ngirim nganyari interim langsung kanggo mesthekake Indeks kita tetep relevan lan migunani kaya sadurunge," perusahaan kasebut nulis ing woro-woro kasebut.
Peringkat judhul
Miturut asil sing diterbitake, Anthropic's Claude Fable 5.1 mimpin Indeks, diikuti dening OpenAI's GPT-6 Astra, sing nambah papat poin tinimbang GPT-5.6 Sol. Meta rangking minangka lab paling kuat nomer telu ing leaderboard, diikuti dening SpaceXAI, Moonshot/Kimi, Z.AI, lan Google.
Anthropic lan OpenAI uga nuduhake gambar efisiensi biaya sing dianyari: loro perusahaan kasebut, bebarengan karo Meta lan Z.AI, ngenggoni wates Pareto "Biaya saben Tugas" Indeks, tegese ora ana laboratorium liyane sing saiki nawakake intelijen sing luwih apik kanggo rega sing padha saben tugas rampung.
Ing efisiensi token, Analisis Artificial nemokake GPT-6 Astra "luwih efisien token tinimbang meh kabeh model liyane sing cedhak karo wates intelijen," karo Claude Fable 5.1, Grok 4.5, lan Gemini 3.5 Flash-Lite lungguh ing salah siji mburi kurva. Perusahaan kasebut nyathet ing analisis kanca, yen panggunaan token Astra luwih murah tinimbang rega sing luwih dhuwur - pangeling yen efisiensi mentah lan biaya total ora mesthi bebarengan.
Apa diganti ing v4.2
Owah-owahan struktural sing paling penting yaiku push sing disengaja nglawan game benchmark. Patang puluh persen saka bobot Indeks saiki asalé saka pribadi, dianakaké-metu test mranata - pindho nuduhake ing v4.1 - kalebu AA-Briefcase, AA-Omniscience, lan solusi kanggo CritPt. Perusahaan kasebut ujar manawa angka kasebut bakal mundhak ing Indeks v5.
Loro evaluasi anyar jangkar nganyari:
- AA-Briefcase, pathokan kerja pengetahuan agenik ing omah kanthi set tes pribadi sing dianakake. Model dievaluasi ing proyek profesional pirang-pirang minggu, saben duwe akeh tugas sing disambung lan ewu file sumber input, lan dinilai liwat kombinasi skor rubrik lan perbandingan pasangan sing kalebu sukses tugas sing bisa diverifikasi, kualitas analitis, lan kualitas presentasi.
- GDP.pdf, digawe dening Surge AI, sing nyoba nalar siji-siji ing dokumen profesional: 100 PDF sing kalebu sepuluh domain, kanthi bukti sing disebar ing 4,592 kaca teks, tabel, grafik, lan cathetan kaki. Tanggapan diklasifikasikake miturut 1.275 kritéria atom sing dikarang pakar, lan judhul All-pass Rate kridit tugas mung nalika saben kritéria wis puas.
Siji pathokan sing wis suwe bakal ditindakake: GPQA Diamond, tes penalaran ilmiah tingkat lulusan, wis dibusak amarga wis jenuh kanthi efektif dening model perbatasan.
Perusahaan kasebut uga nganyarke infrastruktur penilaian, ngeculake AA-LCR v1.1 kanthi pituduh sistem penilaian anyar lan kunci jawaban sing didandani, nyepetake maneh skala Elo kanggo GDPval-AA v2 lan AA-Briefcase supaya rating tetep stabil nalika model anyar teka, lan hardening kothak wedhi grading SciCode supaya kode gagal nanging ora bener maneh.
Apa sing diungkapake tes anyar
Asil ing evaluasi anyar nawakake gambaran sing luwih rinci babagan endi laboratorium perbatasan.
Ing AA-Briefcase, Anthropic's Claude Fable 5.1 lan Opus 5 lead, ngiring dening OpenAI's GPT-6 Astra lan Meta's Muse Spark 1.3. GPT-6 Astra skor kira-kira 85 Elo TCTerms ndhuwur GPT-5.6 Sol ing evaluasi padha - lompat substansial antarane generasi OpenAI sukses.
Ing GDP.pdf, gambar flips: OpenAI ndadékaké karo GPT-6 Astra ing 33,2% All-pass Rate, ngiring dening GPT-5,6 Sol ing 28,2% lan Claude Fable 5,1 ing 26,2%. Bedane kasebut nuduhake sintesis dokumen dawa sajrone konteks sing gedhe banget tetep dadi kekuwatan relatif kanggo model OpenAI sing paling anyar, sanajan model Anthropic mimpin tugas kerja Indeks lan agenik sakabèhé.
Apa mranata test pribadi penting
Pergeseran menyang evaluasi sing ditindakake nggambarake masalah kredibilitas sing luwih akeh ing benchmarking AI. Amarga model wis nyerep data tes umum luwih akeh, laboratorium lan pengamat independen saya kuwatir yen skor judhul ing pathokan sing kondhang nggambarake pangeling-eling utawa latihan sing ditargetake tinimbang kemampuan asli. Kanthi tetep nuduhake akeh tes set pribadi lan bobote luwih abot, Analisis Ponggawa nyoba kanggo njaga sinyal sing leaderboards umum wis ilang.
Perusahaan kasebut ujar manawa wis mbangun unsur Index v5 "suwene pirang-pirang wulan" lan sengaja nahan nganyari supaya Indeks stabil sajrone gelombang peluncuran model utama. Ngluwihi release v4.2 interim, plans nganyari liyane incremental ing mangsa cedhak minangka jangkep transisi v5.
Kanggo para panuku sing milih ing antarane model perbatasan, sing praktis saka v4.2 yaiku sing paling dhuwur ing pasar tetep dadi balapan jaran loro ing antarane Anthropic lan OpenAI, kanthi Meta nutup jurang kasebut - lan evaluasi sing dirancang kanggo tahan game saiki luwih akeh tugas peringkat. Pangguna sing nglacak keputusan pilihan model bisa ngetutake pangembangan AI paling anyar nalika nyedhak peluncuran v5.
Tetep Ahead saka AI
Nganyari pathokan kaya iki mbentuk maneh carane industri ngadili kemajuan. Waca liyane warta AI lan tetep ndhisiki saben rilis model.
Waca liyane warta AI →