Mradi wa chanzo-wazi unaojulikana kidogo unaoitwa Strata una muda mfupi. Injini iliyo na leseni ya MIT, ambayo inaendesha Alibaba's Qwen3.8-Flash-Next - mfano wa mchanganyiko wa wataalam wa bilioni 125 - kwenye Kompyuta za kawaida za michezo ya kubahatisha, iliyopigwa kwenye ukurasa wa mbele wa Habari za Hacker mnamo Oktoba 4 na zaidi ya alama 640, na hazina yake ya GitHub imekusanya zaidi ya 0 Septemba 20, 20.

Msimamo ni rahisi: kielelezo cha kigezo cha bilioni 125 ambacho kwa kawaida huishi kwenye seva kinaweza kupiga gumzo, kuandika msimbo, kusoma picha na kuendesha mawakala wa usimbaji kabisa kwenye kadi ya michoro ya watumiaji, bila chochote kinachoacha mashine.

Kile Strata Kweli Hufanya

Strata ni injini ya uelekezaji na kisakinishi cha mbofyo mmoja kwa Windows na Linux. Kulingana na hati yake, mahitaji ni ya kawaida kulingana na viwango vya mfano wa mipaka: GPU iliyo na angalau 12GB ya VRAM kutoka kwa safu ya NVIDIA ya RTX 20, 30, 40 au 50 au safu ya AMD ya Radeon RX 6000, 7000 au 9000, angalau 32GB ya RAM ya mfumo, na takriban nafasi ya SSD 80 ya bure.

Injini husafirisha matoleo ya Qwen3.8-Flash-Next katika viwango kadhaa vya mbano, kutoka Q2_0 hadi IQ3_S, pamoja na kibadala maalum cha msimbo. Inafichua OpenAI na API zinazooana na Anthropic kwenye localhost, kumaanisha zana zilizoundwa kwa ajili ya ChatGPT au Claude - ikiwa ni pamoja na mawakala wa usimbaji kama vile Msimbo wa Claude, Mshale na Kodeksi - zinaweza kuelekezwa kwenye seva ya karibu na mabadiliko madogo. Ingizo la hiari la picha na usaidizi wa GPU nyingi hujumuishwa, na kisakinishi hata hutoa hali ya usanidi inayosaidiwa na AI ambayo huruhusu msaidizi wa usimbaji kusanidi mashine kutoka kwa kidokezo kimoja kilichobandikwa.

Nambari za Kasi

Vigezo vilivyochapishwa vya mradi, vinavyopimwa kwenye dawati mbili za watumiaji, ndio sababu ya kuenea kwa toleo. Kwenye NVIDIA RTX 5070 yenye 12GB ya VRAM iliyooanishwa na Ryzen 5 7600 na 64GB ya RAM, Strata anaripoti:

  • Ukadiriaji wa Q2_0: tokeni 94 kwa sekunde kwa ajili ya uzalishaji na tokeni 2,650 kwa sekunde kwa usindikaji wa haraka kwenye hati ya tokeni ya 32K
  • IQ3_S: tokeni 53 kwa kila kizazi cha pili, tokeni 1,620 kwa usindikaji wa haraka wa sekunde
  • Lahaja ya msimbo: tokeni 55 kwa kila kizazi cha pili

Kwa upande wa AMD, RX 9070 XT yenye 16GB ya VRAM ilisimamia tokeni 60 kwa sekunde kwa Q2_0. Nyaraka zinakadiria kuwa RTX 3090 iliyo na 24GB ya VRAM inapaswa kufikia tokeni 100 hadi 140 kwa sekunde - haraka kuliko watu wengi wanaweza kusoma.

Kwa kulinganisha, miezi sita iliyopita, kuendesha hata muundo mnene wa kigezo cha bilioni 70 ndani ya nchi kwa kasi inayoweza kutumika kulihitaji kituo cha kufanyia kazi chenye mamia ya gigabaiti za kumbukumbu iliyounganishwa au mbinu za kubahatisha za kusimbua.

Kwa nini Modeli ya 125B Inafaa kwenye Kadi ya Michezo ya Kubahatisha

Vipande viwili vya teknolojia hufanya hivyo iwezekanavyo. Ya kwanza ni mfano yenyewe. Kama AI Buzz Wire ilivyoshughulikia wakati wa kutolewa, Qwen3.8-Flash-Next ni usanifu mchanganyiko wa wataalam wenye takribani vigezo bilioni 125 lakini takriban bilioni 6 tu kwa kila tokeni - kwa hivyo kila neno linalozalishwa hugusa kipande kidogo cha mtandao, na kukata kwa kiasi kikubwa compute kwa kila tokeni.

Ya pili ni quantization. Mipangilio ya awali ya kasi zaidi ya Strata inabana uzani wa modeli hadi biti mbili au tatu kwa kila kigezo, ikifanya biashara ya usahihi fulani kwa alama ya miguu inayotoshea 12GB GPU na RAM ya mfumo. Ubadilishanaji huo ndio tahadhari kuu: Viwango vya darasa la Q2 na IQ2 hudhoofisha ubora kwa njia inayopimika kwenye kazi nzito za kufikiria, na wanunuzi wanapaswa kutilia maanani nambari za kasi ya kichwa kama sehemu ya kuanzia badala ya dhamana kwa kila mzigo wa kazi. Kurasa za kiwango cha jumuiya katika matokeo ya ubora wa wimbo katika saizi mbalimbali.

Sehemu ya Wimbi Kubwa la Ndani-AI

Strata inafika huku kukiwa na kasi ya kuharakisha kwa ufahamu wa ndani. Familia ya Qwen ya Alibaba imekuwa mstari wa mfano wa uzani huria uliopakuliwa zaidi, Meta na Google zina miundo ya ushindani ya vyanzo huria, na wimbi la zana sasa linawaruhusu watumiaji kuendesha wasaidizi wenye uwezo bila usajili au data kuacha vifaa vyao.

Mradi pia unaonyesha jinsi ufafanuzi wa "vifaa vya watumiaji" unavyobadilika. Kadi ya michoro ya wastani ya 2026 yenye 12GB ya VRAM, ambayo ilisafirishwa hasa kwa ajili ya michezo ya kubahatisha, sasa ni kichochezi kinachofaa cha uelekezaji kwa modeli katika darasa la ukubwa ambayo ilifafanua mifumo ya mipaka miaka miwili tu iliyopita.

Strata inabaki kuwa programu ya mapema - hati za kifuatiliaji cha hazina ya kumbukumbu za kingo za GPU za zamani na wasindikaji zisizo za AVX2 - lakini mradi huo una leseni ya MIT, bila malipo, na umeendelezwa wazi, kwa msaada wa majaribio kwa Intel Arc, kadi za zamani za Tesla na Radeon, na rigi za GPU nyingi zilizoandikwa na wanajamii.

Kwa wasanidi programu, njia inayofaa zaidi ya kuchukua inaweza kuwa uoanifu wa API ya mwenyeji: hati yoyote au wakala aliyeandikwa dhidi ya OpenAI au SDK ya Anthropic inaweza kuelekezwa kwenye uwekaji wa eneo la Qwen kwa kubadilisha URL ya msingi, na kuifanya Strata kuwa chaguo la msuguano wa chini kwa prototyping nyeti kwa faragha, matumizi ya nje ya mtandao, au kuweka tu matumizi ya API.

Jinsi ya Kuijaribu

Kuanza hakuhitaji kipindi cha mwisho kilicho na mwongozo. Visakinishi hutoa viendeshaji, uzani wa modeli na seva ya ndani katika pasi moja, na hifadhi inajumuisha faili ya usanidi iliyoundwa kwa kubandikwa moja kwa moja kwenye msaidizi wa usimbaji wa AI, ambayo kisha husanidi mashine kwa uhuru. Uzinduzi wa kwanza ni polepole wakati uzani hupakia kutoka kwa diski; hati inapendekeza SSD na inaonya kuwa mazungumzo marefu hubadilisha kazi zaidi kwenye RAM ya mfumo.

Kaa Mbele ya AI

Fuata AI Buzz Wire ili upate habari mpya kuhusu miundo ya programu huria, zana za ndani za AI na maunzi ya marejeleo.

Soma habari zaidi za AI →