Maabara ya AI iliyogatuliwa Prime Intellect imechapisha matokeo ya jaribio la kiwango kikubwa jinsi miundo ya AI ya mipakani ya leo inaweza kufanya utafiti wa kujitegemea wa kujifunza mashine - na bora zaidi kati yao ilikaribia sana kulinganisha rekodi ya dunia ya binadamu kwenye kigezo kinachoadhimishwa cha jumuiya.
Mradi huo, uliopewa jina la NanoGPT Speedrun Frontier na kuchapishwa mnamo Agosti 22, ulijumuisha milipuko 153 inayojitegemea katika miundo 18 ya mipaka inayojaribu kukimbia kwa kasi ya kiboreshaji cha nanoGPT - shindano ambalo watafiti hutafuta njia bora zaidi ya kufunza modeli ya lugha ndogo kwa lengwa ya ubora usiobadilika. Hadithi ilipanda haraka ukurasa wa mbele wa Hacker News, ambapo ilivuta maoni kadhaa yakijadili matokeo yanasema nini kuhusu uwezo wa AI wa ugunduzi wa kweli wa kisayansi. For more context on this story, see our ongoing more AI stories.
Speedrun ya NanoGPT ni nini hasa
Alama hutoka kwa hazina ya modded-nanogpt inayodumishwa na Keller Jordan na orodha ndefu ya wachangiaji wa jamii. Changamoto ni rahisi kwa udanganyifu kutaja: kwa kutumia GPU 8 za NVIDIA H100, fundisha muundo wa lugha unaofikia upotevu wa 3.28 kwenye seti ya uthibitishaji wa FineWeb - kiwango cha utendakazi urudiaji asili wa GPT-2 wa Andrej Karpathy kufikiwa baada ya dakika 45 - haraka iwezekanavyo.
Kupitia mamia ya michango ya jumuiya katika kipindi cha miaka miwili iliyopita, rekodi ya binadamu imeshushwa hadi chini ya sekunde 75 na chini ya tokeni za mafunzo milioni 400, uboreshaji zaidi ya mara 30 juu ya mapishi asili. Masuluhisho yaliyoshinda yalisomeka kama orodha ya uhandisi wa kisasa wa ML: kiboreshaji cha Muon, upachikaji wa mzunguko na QK-Kawaida, uwezeshaji wa mraba wa ReLU, ukadiriaji wa FP8 kwa umakini na pasi za MLP, Flash Attention 3 yenye mifumo ya madirisha ya kuteleza, na mbinu zingine kadhaa zilizopangwa juu ya nyingine.
Jaribio la Prime Intellect lilitumia wimbo wa kiboreshaji cha benchmark, ambayo - kulingana na hati ya hazina - hupunguza idadi ya hatua za mafunzo zinazohitajika kufikia upotezaji unaolengwa, kulingana na usanifu uliowekwa, seti ya data na saizi ya bechi, na bajeti ya saa ya ukuta isiyo na kikomo. Hiyo inafanya kuwa mtihani safi wa ugunduzi wa algorithm badala ya kasi ya vifaa vya ghafi.
Jinsi Jaribio lilivyofanya kazi
Kila moja ya miundo 18 ilipewa jukumu hili kivyake: pendekeza mabadiliko kwenye kichocheo cha mafunzo, endesha majaribio, kagua matokeo, na urudie tena - kwa hati isiyobadilika ya uthibitishaji na mbegu za nasibu zisizobadilika kuhakikisha kwamba uboreshaji unaodaiwa ni wa kweli badala ya kukimbia kwa bahati. Kama mtoa maoni mmoja wa Hacker News alivyoifupisha, wanamitindo waliulizwa kutafiti jinsi ya kuboresha mafunzo ya modeli ndogo, kujaribu mara kwa mara mabadiliko, kuyajaribu, na kutumia matokeo kuamua nini cha kujaribu ijayo.
Miundo hiyo ilifanya kazi kupitia aina mbalimbali za viunga vya mawakala - ikiwa ni pamoja na msimbo wa claude, kodeksi ya OpenAI, kimi-code, grok-cli, qwen-code, na wakala mkuu wa Prime Intellect - na timu ilifuatilia kila matumizi ya tokeni, hesabu ya majaribio, simu za zana na muda wa wakala uliopita. Kwa jumla, jaribio lilitumia mamia ya mamilioni ya tokeni kwa kila muundo wa juu na mabilioni kwenye gridi kamili.
Ubao wa Wanaoongoza: Hadithi ya 5 Inaongoza Kifurushi
Matokeo ya kichwa: muundo uliotambuliwa kama Hadithi ya 5, inayopitia uunganisho wa msimbo wa claude, ulifunga asilimia 81.7 ya pengo kati ya kichocheo cha msingi na rekodi ya binadamu, na matokeo yaliyothibitishwa vyema ya 2,726 kwenye kipimo cha ubao wa wanaoongoza. Kufika huko kulichukua muda wa siku 8.7 za muda wa wakala, takriban tokeni milioni 800, majaribio 811 na takriban simu 3,000 za zana.
Kundi la kufukuza liliongozwa na Opus 5, ambayo iliziba asilimia 53.6 ya pengo, ikifuatiwa kwa karibu na Kimi K3 kwa asilimia 52.2 ikiendeshwa na wakala mkuu wa Prime Intellect (na asilimia 45.8 kupitia kimi-code). Opus 4.8 ilisimamia asilimia 39.4, anuwai kadhaa za GPT-5.6 zilifika kati ya takriban asilimia 11 na 36, Sonnet 5 ilifunga asilimia 26.8, na Grok 4.5 na Qwen3.8 Max kila moja ilifikia takriban asilimia 24.6.
Zaidi chini, DeepSeek V4 Pro ilifunga asilimia 12.3 ya pengo, GPT-5.5 ilifikia asilimia 8.1, na Kimi K2.7 wakubwa alimaliza kwa asilimia 7.2. Hasa, mtindo mmoja uliotolewa hivi majuzi - GLM 5.3 - ulikuwa bado unafanya kazi wakati wa uchapishaji bila rekodi iliyoidhinishwa, ukumbusho kwamba alama hiyo inaadhibu miundo ambayo haiwezi kuthibitisha uboreshaji wao wenyewe.
Kwanini Ni Muhimu
Vigezo kama jambo hili kwa sababu hupima kitu ambacho mbao za wanaoongoza za usimbaji haziwezi: uwezo wa kutekeleza kitanzi halisi cha utafiti - nadharia, majaribio, uchambuzi, masahihisho - kwa siku badala ya dakika. Uwezo huo ndio msingi wa uwanja unaoibuka wa utafiti unaojitegemea wa AI, ambapo maajenti hawapewi jukumu la kuandika nambari ili kubainisha lakini kwa kugundua vitu ambavyo hakuna mtu aliyewaonyesha.
Kuenea kwa matokeo yenyewe ni habari. Takriban kila modeli katika jaribio ilipata mawazo sawa ya ushindi, kulingana na uandishi wa mradi - kilichotenganisha uendeshaji bora zaidi ni kile ambacho jaribio linaacha nyuma: mawakala wenye nguvu zaidi walihifadhi ishara dhaifu katika matokeo ya kelele kwa muda wa kutosha kuzithibitisha, na kuelewa data yao ya majaribio bora zaidi.
Tahadhari Kutoka kwa Jumuiya
Watoa maoni wa Hacker News waliibua hoja za mbinu za haki. Mipangilio ya juhudi na viunga vilitofautiana katika miundo - Hadithi ya 5 iliendeshwa kwa mpangilio wa juu wa hoja huku Opus 5 ikitumia kiwango cha juu - na hesabu ya mikimbio 153 kati ya miundo 18 ina maana kwamba baadhi ya miundo ilipokea majaribio zaidi kuliko nyingine. Ikiwa cheo cha mwanamitindo kinaonyesha uwezo wake mbichi wa utafiti au ubora wa unganisho lake bado ni swali wazi.
Bado, mwelekeo wa kusafiri uko wazi. Wakati mikono ya binadamu yenye kasi ilichukua miaka ya juhudi za pamoja kufikia rekodi ya sasa, mawakala bora zaidi wanaojiendesha sasa wanaziba pengo hilo kwa zaidi ya wiki moja ya muda wa kukokotoa. Swali linalofuata - ikiwa mtindo wowote unaweza kufunga asilimia 18.3 iliyobaki - linaweza kujibiwa mapema kuliko ilivyotarajiwa.
Kwa zaidi juu ya viwango na utafiti wa kuunda mipaka ya AI, fuata utangazaji unaoendelea wa AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →