Kampuni inayolinganisha Uchambuzi Bandia ilitoa toleo la 4.2 la Kielezo chake cha Ujasusi mnamo Septemba 4, 2026, sasisho la muda ambalo hurekebisha jinsi miundo ya mipaka ya AI inavyopimwa - na, kulingana na ubao mpya wa wanaoongoza, Anthropic's Claude Fable 5.1 inashikilia nafasi ya juu, huku GPT-6 ya GPT-6 ya Astra-5 ya OpenAI ikipata nafasi ya pili ya Sol.

Sasisho linakuja miezi minane tu baada ya Index v4 kuzinduliwa mnamo Januari, mabadiliko ya haraka isiyo ya kawaida ya sifa za kampuni kwa kasi ya matoleo ya hivi karibuni ya mipaka. "Kwa kuwa mipaka inasonga haraka sana katika wiki zilizopita, tunahisi ni muhimu kutoa sasisho la muda mfupi ili kuhakikisha Index yetu inabaki kuwa muhimu na muhimu kama zamani," kampuni iliandika katika tangazo lake.

Viwango vya kichwa

Kulingana na matokeo yaliyochapishwa, Anthropic's Claude Fable 5.1 inaongoza Index, ikifuatiwa na OpenAI's GPT-6 Astra, ambayo iliboresha pointi nne zaidi ya GPT-5.6 Sol. Meta inaorodheshwa kama maabara ya tatu kwa nguvu kwenye ubao wa wanaoongoza, ikifuatiwa na SpaceXAI, Moonshot/Kimi, Z.AI, na Google.

Anthropic na OpenAI pia hushiriki picha iliyosasishwa ya ufanisi wa gharama: kampuni hizo mbili, pamoja na Meta na Z.AI, zinamiliki mpaka wa Pareto wa "Cost per Task" ya Pareto, kumaanisha kwamba hakuna maabara nyingine ambayo kwa sasa inatoa akili bora zaidi kwa bei sawa kwa kila kazi iliyokamilika.

Juu ya ufanisi wa ishara, Uchanganuzi Bandia ulipata GPT-6 Astra "yenye ufanisi zaidi wa ishara kuliko karibu kila modeli nyingine karibu na mipaka ya upelelezi," na Claude Fable 5.1, Grok 4.5, na Gemini 3.5 Flash-Lite wakiwa wamekaa kila mwisho wa mkunjo. Kampuni hiyo ilibainisha katika uchanganuzi shirikishi, hata hivyo, kwamba matumizi ya tokeni ya chini ya Astra yanazidiwa na bei zake za juu - ukumbusho kwamba ufanisi mbichi na gharama zote hazisongi pamoja kila wakati.

Nini kilibadilika katika v4.2

Mabadiliko muhimu zaidi ya muundo ni msukumo wa makusudi dhidi ya uchezaji wa kuigwa. Asilimia arobaini ya uzani wa Index sasa inatoka kwa seti za majaribio za kibinafsi, zilizoshikiliwa - mara mbili ya sehemu katika v4.1 - ikijumuisha AA-Briefcase, AA-Omniscience, na suluhisho za CritPt. Kampuni hiyo ilisema kwamba takwimu itaongezeka zaidi katika Index v5.

Tathmini mbili mpya zinaunga mkono sasisho:

  • Aa-Briefcase, alama ya kazi ya maarifa ya wakala wa ndani na seti ya majaribio ya kibinafsi. Miundo hutathminiwa kwenye miradi ya kitaalamu ya wiki nyingi, kila moja ikiwa na kazi nyingi zilizounganishwa na maelfu ya faili za chanzo cha ingizo, na kupangwa kupitia mseto wa alama za rubriki na ulinganisho wa jozi unaofunika mafanikio ya kazi yanayothibitishwa, ubora wa uchanganuzi na ubora wa uwasilishaji.
  • GDP.pdf, iliyoundwa na Surge AI, ambayo hujaribu hoja za zamu moja kwenye hati za kitaaluma: PDF 100 zinazotumia vikoa kumi, na ushahidi unaosambazwa katika kurasa 4,592 za maandishi, majedwali, chati na tanbihi. Majibu yamewekwa katika daraja dhidi ya vigezo 1,275 vya atomiki vilivyoidhinishwa na wataalamu, na kichwa cha habari cha Kiwango cha Waliopitisha Kila kitu kinaonyesha kazi ikiwa tu kila kigezo kimetimizwa.

Kigezo kimoja cha muda mrefu kiko njiani kutoka: GPQA Diamond, mtihani wa kufikiri wa ngazi ya wahitimu, imeondolewa kwa sababu imejaa mifano ya mipaka.

Kampuni pia iliboresha miundombinu yake ya uwekaji madaraja, ikitoa AA-LCR v1.1 kwa mfumo mpya wa kuorodhesha haraka na funguo za kujibu zilizosahihishwa, ikiweka tena kiwango cha Elo cha GDPval-AA v2 na AA-Briefcase ili ukadiriaji uendelee kuwa thabiti miundo mipya inapowasili, na kufanya ugumu wa masanduku ya kuorodhesha ya SciCode kama hesabu ya kutofaulu tena ili kutofaulu.

Kile ambacho majaribio mapya yanafichua

Matokeo kwenye tathmini mpya hutoa picha ya punjepunje zaidi ya mahali ambapo maabara za mipaka zinasimama.

Kwenye AA-Briefcase, Claude Fable 5.1 ya Anthropic na Opus 5 inaongoza, ikifuatiwa na GPT-6 Astra ya OpenAI na Meta's Muse Spark 1.3. GPT-6 Astra inapata takriban pointi 85 za Elo juu ya GPT-5.6 Sol kwenye tathmini sawa - mruko mkubwa kati ya vizazi vilivyofuatana vya OpenAI.

Kwenye GDP.pdf, picha inabadilika: OpenAI inaongoza kwa kutumia GPT-6 Astra kwa 33.2% All-pass Rate, ikifuatiwa na GPT-5.6 Sol kwa 28.2% na Claude Fable 5.1 kwa 26.2%. Tofauti hiyo inapendekeza usanisi wa hati ndefu juu ya miktadha mikubwa sana inasalia kuwa nguvu linganifu kwa muundo mpya kabisa wa OpenAI, hata vile miundo ya Anthropic inaongoza Fahirisi ya jumla na kazi za kazi za mawakala.

Kwa nini seti za majaribio ya kibinafsi ni muhimu

Mabadiliko kuelekea tathmini iliyosimamishwa inaonyesha tatizo pana la uaminifu katika uwekaji alama wa AI. Kadiri miundo inavyochukua data zaidi ya majaribio ya umma, maabara na waangalizi huru wamekua na wasiwasi kwamba alama za vichwa vya habari kwenye vigezo vinavyojulikana zaidi zinaonyesha kukariri au mafunzo yanayolengwa badala ya uwezo halisi. Kwa kuweka sehemu inayokua ya majaribio yake ya faragha na kuyapa uzito zaidi, Uchanganuzi Bandia unajaribu kuhifadhi ishara kwamba bao za wanaoongoza za umma zimekuwa zikipoteza.

Kampuni hiyo ilisema imekuwa ikiunda vipengee vya Index v5 "kwa miezi" na ilizuia masasisho kwa makusudi ili kuweka Index dhabiti kupitia wimbi la hivi karibuni la uzinduzi wa modeli kuu. Zaidi ya toleo la muda la v4.2, inapanga masasisho zaidi katika siku za usoni inapokamilisha mpito wa v5.

Kwa wanunuzi wanaochagua kati ya miundo ya mipakani, manufaa ya kuchukua kutoka v4.2 ni kwamba sehemu ya juu ya soko inasalia kuwa mbio za farasi wawili kati ya Anthropic na OpenAI, huku Meta ikifunga pengo - na kwamba tathmini zilizoundwa kustahimili michezo ya kubahatisha sasa zinafanya kazi zaidi ya kuorodhesha. Watumiaji wanaofuatilia maamuzi ya uteuzi wa kielelezo wanaweza kufuata maendeleo ya hivi punde ya AI kadri uchapishaji wa v5 unavyokaribia.

Kaa Mbele ya AI

Masasisho ya kiwango kama hiki hurekebisha jinsi tasnia inavyotathmini maendeleo. Soma habari zaidi za AI na utangulie kila toleo la modeli.

Soma habari zaidi za AI →