Utafiti wa Fataki, timu ya mfano ndani ya uanzishaji wa Fataki AI, imeanzisha Ember-1, modeli maalum ambayo kampuni inasema inatoa majibu sawa na Kimi K3 ya Moonshot AI huku ikitoa takriban tokeni 40% chache. Muundo huu ulianza kuonyeshwa kwenye jukwaa la Fireworks mnamo Septemba 23, na katika siku chache zilizopita imekuwa mojawapo ya matoleo yaliyojadiliwa zaidi katika jumuiya ya wasanidi programu, na kuibua mamia ya kura za maoni kwenye Habari za Hacker huku watengenezaji wa codes wakijadili ikiwa tokeni za hoja ndizo mipaka ya gharama inayofuata.
Msimamo unakuja wakati ambapo bili za uelekezaji, sio uwezo wa mfano, zinazidi kuamua ni timu gani zinaweza kumudu kusafirisha. Kwa timu zinazotazama mzigo wa kazi wa mawakala hutumia bajeti, maendeleo ya hivi punde ya AI yamebainisha jambo moja wazi: tabia ghali zaidi ya tasnia kwa sasa si mafunzo ya miundo ya mipakani, inaziendesha. Ember-1 ni jaribio la Fireworks kushambulia tatizo hilo moja kwa moja, na kampuni iliiunga mkono kwa seti ya kina isiyo ya kawaida ya nambari za alama na za uzalishaji.
Wanamitindo Wanaofikiri Wanafikiri Sana
Uchunguzi wa msingi nyuma ya Ember-1 ni kwamba miundo ya kufikiri kama Kimi K3 hutumia tokeni nyingi zinazozalishwa - wakati mwingine zaidi ya 90%, kulingana na Fireworks - kwenye hoja za ndani badala ya jibu lenyewe. Kwa ombi moja, hiyo ni ghali. Katika mzigo wa kazi wa mawakala, huchanganyika: kila zamu ya mazungumzo ya wakala hurudia hoja zote za awali kwa muundo, kwa hivyo muktadha hukua takribani mara nne kwa idadi ya zamu, na ufuatiliaji wa hoja ndefu kutoka zamu za mapema husomwa tena na kutozwa tena kwa kila simu inayofuata.
Fataki husema wateja waliwaambia wanataka uwezo wa kuweka msimbo wa Kimi K3 kwa gharama ya chini, lakini kukataa tu jitihada za kufikiri za mwanamitindo hakukufaulu - mipangilio ya juhudi ndogo iliacha ubora mwingi. Njia mbadala ilikuwa kutoa mafunzo kwa mtindo ambao husababisha kwa ufanisi zaidi wakati wa kuweka hoja ambayo ni muhimu.
Kufunza Taka
Building Ember-1 ilichukua zaidi ya majaribio 50 ya mafunzo na tathmini zaidi ya 200, inayoendeshwa kikamilifu kwenye jukwaa la Mafunzo ya Fataki, kulingana na chapisho la blogu la kampuni. Timu inasema ilitengeneza kanuni mpya za mafunzo njiani ili kufupisha hoja bila kupoteza usahihi.
Hasa, kampuni haikujaribu kuondoa hoja za jumla. Baadhi ya kitenzi kinachoonekana cha Kimi K3 ni kujiakisi kwa manufaa - kurejea dhana, kujibu maoni, au kufuatilia matokeo hadi uamuzi wa awali husaidia mtindo kupona kutokana na makosa. Utaratibu wa mafunzo uliundwa ili kuhifadhi uwezo huo huku ukipunguza vitanzi visivyo na tija.
Data ya mafunzo ilihusisha hisabati, usimbaji, maelekezo ya kufuata, mazungumzo, utafutaji, matumizi ya zana na uhandisi wa programu, inayoshughulikia matatizo ya pekee na mwingiliano uliopanuliwa wa zamu nyingi. Fataki inasema ilitumia data yake pekee na hakuna data ya mteja.
Vigezo: Juu au Karibu na Pareto Frontier
Ili kusuluhisha gharama, Fataki ilikokotoa gharama ya kila kipimo kwa kutumia bei ya API ya umma ya Kimi K3 - $3 kwa kila tokeni milioni za pembejeo ambazo hazijahifadhiwa, $0.30 kwa kila tokeni milioni zilizohifadhiwa, na $15 kwa kila tokeni za pato milioni - na kulinganisha Ember-1 dhidi ya K3 kwa juhudi ya chini, ya juu na ya juu zaidi ya kufikiria. Katika kila kipimo kilicho na zaidi ya sampuli 50 za majaribio, kampuni inaripoti kwamba Ember-1 inakaa juu au karibu na mpaka wa Pareto, ikilingana na K3 kwa bidii kubwa kwa sehemu ya gharama na kutawala K3 kwa bidii kidogo.
Kichwa cha habari kinalinganisha dhidi ya K3 kwa bidii nyingi, kama ilivyoripotiwa na Fataki:
| Benchmark | Sampuli | K3 (juhudi za juu) | Ember-1 |
|---|---|---|---|
| Benchi la Kituo 2.1 | 89 | 80.9% | 82.0% |
| SWE-benchi Imethibitishwa | 500 | 93.2% | 92.2% |
| SWE-Ingiliano | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-Bench Airline | 50 | 64% | 66% |
Kwa gharama kwa kila kazi, Fataki huripoti Ember-1 ilipunguza matumizi kwa 51.9% kwenye Kituo cha Kituo cha 2.1, 32.5% kwenye SWE-Interact, 23.7% kwenye DeepSWE 1.1, na 15.5% kwenye SWE-benchi Imethibitishwa ikilinganishwa na K3 kwa bidii kubwa - katika kesi ya DeepSWE ya zaidi ya $12 ya kazi kwa kila kitengo cha $12 kwa kila kampuni. viwango.
Kampuni pia ilitathmini Ember-1 kwenye Benchi ya Kando ya Kitanda ya Doximity, alama iliyoidhinishwa na daktari ya kesi 500 za kimatibabu katika taaluma 10 ambazo Fataki hupitia Fahirisi yake mpya ya Upelelezi Maalum iliyozinduliwa. Hapo, Fireworks inasema Ember-1 iliweka mpaka mpya wa Pareto kwa gharama kwa kila kazi katika miundo iliyofunguliwa na iliyofungwa, ikiwa ni pamoja na GPT-5.6 Sol, GPT-6 Astra, na Claude Opus 5. Dai hilo linatokana na faharasa ya Fireworks yenyewe na haijathibitishwa bila kujitegemea.
Trafiki ya Moja kwa Moja: Tokeni chache, Alama Sawa
Vigezo ni jambo moja; uzalishaji ni mwingine. Fataki zilifanya majaribio ya moja kwa moja ya A/B na wateja wawili kwenye mzigo wao wa kazi wa usimbaji wa uzalishaji na inaripoti kuwa Ember-1 ilitumia takriban 35% tokeni chache kwa kila kazi kwa ubora ulinganifu. Katika ulinganisho mmoja uliopimwa, Kimi K3 alifunga 0.751 huku akizalisha tokeni 49,300 za matokeo kwa kila kazi, dhidi ya 0.753 kwa Ember-1 kwenye tokeni 29,900 - kupunguzwa kwa 71.3% kwa ishara na 39% chini ya jumla ya ishara. Kufuatia majaribio hayo, mteja mmoja alihamisha Ember-1 katika toleo la moja kwa moja kwa mipango ya kuiongeza ili kuchukua nafasi ya muundo msingi kabisa.
Ndani ya Fireworks yenyewe, modeli ilibadilishwa kimya kimya katika utiririshaji wa usimbaji wa kampuni kabla ya kuzinduliwa. Matokeo ambayo timu inasema inajivunia: hakuna mtu aliyegundua. Wasanidi programu waliendelea na kazi yao bila kugundua swichi huku wakitumia tokeni chache zaidi.
Akili Maalum kama Mkakati
Ember-1 ndiye kielelezo cha kwanza katika mfululizo uliopangwa kutoka kwa Utafiti wa Fataki, na inakuja pamoja na Kielezo Maalum cha Upelelezi cha kampuni, juhudi ya kulinganisha iliyoanzishwa mapema mwezi huu ili kulinganisha miundo iliyo wazi, iliyofungwa na maalum kwenye kazi za ulimwengu halisi zilizoundwa na wataalamu.
Mchezo wa kimkakati ni rahisi kusoma. Badala ya kutoa mafunzo kwa kielelezo cha mipaka kuanzia mwanzo, Fataki zilichukua muundo dhabiti wa uzani wazi, uliofunzwa ufanisi wa tokeni, na sasa inauza uwezo sawa kwa gharama ya chini kwa kila kazi. Huku matoleo ya uzani huria kutoka kwa maabara kama vile Moonshot yakiendelea kuziba pengo la uwezo, watoa huduma wa makisio wanagundua kuwa upambanuzi wa kudumu unaweza kuwa wa gharama kwa kila kazi iliyokamilika badala ya nafasi ya ubao wa wanaoongoza - mabadiliko ambayo yanapendelea kampuni zilizo na mafunzo thabiti na miundombinu inayohudumia.
Mawazo yanafaa kutajwa kwa uwazi: nambari zilizo hapo juu zinatoka kwenye blogu ya Fataki yenyewe, tathmini zake yenyewe na wateja wake wanaolipa. Uigaji wa kujitegemea wa akiba ya ishara kwenye mizigo ya kazi ya nje itakuwa mtihani halisi. Lakini ikiwa matokeo yatashikilia, njia ya gharama nafuu zaidi ya kuendesha modeli ya wazi ya kiwango cha mipaka inaweza isiwe tena kuifanya ifikirie kidogo - inaweza kuwa kuendesha muundo uliojifunza kufikiria kwa ufanisi.
---
Pata habari za hivi punde za AI, uchanganuzi na mafanikio - yote katika sehemu moja.
Soma habari zaidi za AI →