Alama mpya ni changamoto jinsi tasnia ya AI inavyopima uwezo wa kisayansi, na matokeo yake ya kwanza ni ya kufedhehesha kwa maabara za mipaka. Terminal-Bench-Sayansi 0.1, iliyozinduliwa wiki hii na watafiti katika Chuo Kikuu cha Stanford na timu iliyo nyuma ya alama maarufu ya uwekaji wa alama za Terminal-Bench, inatathmini mawakala wa AI juu ya mtiririko halisi wa utafiti wa kisayansi uliochangiwa na wanasayansi wanaofanya kazi - na mfano hodari uliojaribiwa, Claude Opus 5 inayopitia Nambari ya Claude, ilikamilisha 30% tu ya kazi.
Ukurasa wa tangazo wa alama ya alama unaelezea kanuni yake ya mwongozo kwa uwazi: wanasayansi, si watengenezaji wa mfano au wachuuzi wa data, wanapaswa kuweka upau wa uwezo wa kisayansi katika AI. Mradi huu ulijengwa kwa ushirikiano na wataalamu wa kikoa kutoka taasisi za utafiti kote ulimwenguni, na kutolewa kwake kwa mara ya kwanza ni pamoja na kazi 70 zinazojumuisha sayansi ya maisha, fizikia, sayansi ya Dunia, hisabati, na uhandisi.
Jinsi Inavyotofautiana na Vigezo vya Vitabu vya kiada
Tathmini nyingi za kisayansi za AI hujaribu maarifa: maswali ya chaguo nyingi, shida za kiada, mazoezi sanifu. Terminal-Bench-Science badala yake hupima ikiwa mawakala wanaweza kutekeleza utiririshaji wa kazi unaohitaji muda wa kitaalam, unaotumia muda mwingi ambao hujaza siku halisi za watafiti - aina ya kazi ambayo haionekani bila mitihani. Majukumu yanayotekelezwa katika mazingira halisi, na uwekaji madaraja unategemea vizalia vya programu halisi: uchanganuzi, uigaji, uthibitisho, msimbo na bidhaa za data, zinazoangaliwa kwa majaribio yanayojirudia ya kazi mahususi badala ya miundo ya majaji au matokeo ya chaguo nyingi.
Ubunifu huo unaonyesha nadharia ya kile wasaidizi wa AI wanapaswa kufanya kwa sayansi. Badala ya kuchukua nafasi ya uamuzi wa kisayansi, waandishi wa benchmark wanabishana, mawakala wanapaswa kuchukua safu ya utekelezaji - kuendesha majaribio-katika-silika, kuchakata data, kuangalia uthibitisho - kuwaweka huru wanasayansi kwa sehemu za utafiti ambapo uamuzi wa mwanadamu ni muhimu zaidi: kufafanua maswali, kuunda nadharia, kutafsiri matokeo, na kuwasilisha matokeo.
Mradi pia umejengwa kwa uwazi kama lengo la kusonga mbele. Ambapo vigezo vingi vinatolewa mara moja na kuachwa - tangazo linaita hili "karatasi za kuchapisha" tatizo - Terminal-Bench-Science imeundwa kama alama inayoendelea ambayo hubadilika pamoja na mipaka, na matoleo ya kawaida yanalenga kuweka tathmini mbele ya maendeleo ya mfano na kuzuia mfumuko wa bei unaotokana na uchafuzi.
Ubao wa Kwanza wa Wanaoongoza: Njia ndefu kutoka kwa Kutegemewa
Ubao wa wanaoongoza wa v0.1, ambao ulivutia umakini mkubwa ulipofikia Habari za Hacker wiki hii, unaonyesha kushuka kwa kasi kutoka juu:
- Claude Opus 5 (Msimbo wa Claude): 30.0%
- GPT-5.6 Sol (Kodeksi): 22.4%
- Claude Fable 5 (Msimbo wa Claude): 21.4%
- Claude Opus 4.8 (Msimbo wa Claude): 10.5%
- GPT-5.6 Terra (Kodeksi): 8.6%
- GLM 5.3 (Msimbo wa Claude): 8.1%
- Kimi K3 (Msimbo wa Claude): 7.1%
- Grok 4.6 (Grok Build): 7.1%
- GPT-5.6 Luna (Kodeksi): 3.3%
Matokeo yanapendekeza utiririshaji wa kazi wa kisayansi unasalia kuwa mgumu zaidi kwa mawakala kuliko uhandisi wa programu, ambapo Benchi asilia ya Terminal-Bench na vigezo pinzani vya usimbaji vimeona alama zikipanda kwa kasi. Asilimia 30 ya utatuzi wa mfumo bora unaopatikana inamaanisha kuwa katika kazi saba kati ya kumi za utafiti halisi, hata wakala wa kiwango cha juu aliyeoanishwa na kuunganisha imara hushindwa kutoa kazi iliyo sahihi.
Kuenea ndani ya familia za mfano pia kunafundisha. Pengo kati ya Claude Opus 5 na Claude Opus 4.8 - karibu pointi ishirini - na kati ya lahaja za GPT-5.6 Sol, Terra, na Luna inaonyesha ni kiasi gani ubora wa matokeo unategemea mwingiliano wa muundo na uunganisho wa wakala, si akili mbichi ya mfano pekee. Kila ingizo la alama ya juu hutumia kuunganisha mawakala (Msimbo wa Claude, Codex, Grok Build), ikiimarisha makubaliano yanayoibuka kwamba kiunzi ni muhimu kama vile uzani wa msingi.
Kwa Nini Wanasayansi Walijijengea Benchmark
Muundo wa kigezo hubeba hoja fiche ya kitaasisi. "Dau katika sayansi ni kubwa mno," tangazo hilo linasema, "na vigezo vyake lazima vionyeshe vipaumbele vya jumuiya ya wanasayansi badala ya maslahi ya nje." Mradi huo unawapa watafiti wanaofanya kazi utaratibu wa moja kwa moja wa kusimba kazi wanazohitaji kiotomatiki - na kushikilia madai ya wachuuzi ya "kuharakisha ugunduzi wa kisayansi" dhidi ya kiwango kinachoweza kuthibitishwa.
Hiyo ni muhimu kwa sababu pengo kati ya uuzaji na ukweli ina matokeo halisi. Iwapo maabara za mipakani zitadai mawakala wao wanaweza kuharakisha utafiti huku tathmini huru, iliyoundwa na wataalam zinaonyesha viwango vya utatuzi wa tarakimu moja hadi 30%, maamuzi ya ufadhili, mipango ya uajiri na sera za maabara zilizoundwa kwa madai hayo hurithi makosa. Vigezo vinavyoendelea, vinavyomilikiwa na jumuiya ni marekebisho moja: hubadilisha madai yasiyoeleweka kuwa nambari zinazoweza kutolewa tena.
Ishara kwa Taasisi za Utafiti
Kwa vyuo vikuu, maabara za kitaifa, na timu za R&D zinazopima wakati wa kupeleka mawakala, kielelezo hutoa kitu ambacho maonyesho ya wachuuzi hayawezi: kipimo kinachodumishwa na jumuiya cha mahali ambapo laini ya kuaminika inakaa. Kiwango cha azimio katika vijana au miaka ya ishirini kinamaanisha kuwa mifumo hii inachukuliwa vyema leo kama wasaidizi wanaohitaji ukaguzi, na si kama watekelezaji huru wa mabomba ya majaribio. Kategoria za kazi - zinazojumuisha maisha, sayansi ya mwili, Dunia, hisabati na uhandisi - pia huwapa wataalamu wa kikoa kiolezo cha kuchangia mtiririko wa kazi kutoka kwa nyanja ambazo alama za kawaida hazizingatiwi.
Muktadha mpana wa tasnia unasisitiza kwa nini wakati ni muhimu. Sayansi imekuwa mojawapo ya kesi za utumiaji zinazokuzwa sana kwa mipaka ya AI, huku maabara zikitoa michango katika ugunduzi wa nyenzo, sayansi ya protini na hisabati. Madai hayo ni magumu kukagua: matokeo ya kisayansi ni polepole kuthibitishwa, na shauku husonga kwa kasi zaidi kuliko urudufishaji. Kigezo ambacho huweka alama za vizalia vya programu vinavyoweza kuthibitishwa kwenye mtiririko halisi wa kazi huzipa taasisi za utafiti njia ya kutenganisha uwezo ulioonyeshwa kutoka kwa ukumbi wa maonyesho - na kufuatilia, kutolewa kwa kutolewa, ikiwa maendeleo ya mawakala katika sayansi yanachanganyika haraka kama ilivyo katika uhandisi wa programu, ambapo Kituo-Benchi kilitoa jina lake kwa mara ya kwanza.
Kwa tasnia ya AI, ujumbe wa v0.1 una pande mbili. Mpaka unasonga mbele kwa uwazi - Opus 5's 30% minara juu ya Opus 4.8's 10.5% ya zamani - lakini dari inabakia mbali na kutegemewa kwa maabara halisi. Wabunifu wa alama hizo wanasema matoleo ya mara kwa mara yatafuatilia hasa jinsi pengo hilo linaziba. Wanasayansi wanaotazama mitindo inayoibuka ya AI katika zana za utafiti za kimawazo sasa wana kigezo walichojitengenezea.
---
Kaa Mbele ya AIPata habari za hivi punde za AI, uchanganuzi na mafanikio - yote katika sehemu moja.
Soma habari zaidi za AI →