Mradi mdogo lakini wa kuvutia unasambazwa kwenye Habari za Wadukuzi wiki hii: openTPU, kichapuzi cha AI cha chanzo huria ambacho muundo wake wa maunzi ulitolewa na mawakala wa AI. Hifadhi, iliyochapishwa chini ya leseni ya Apache 2.0 kwenye GitHub, inaelezea kile ambacho waandishi wake wanakiita "kiongeza kasi cha AI cha chanzo huria, kilichotengenezwa na AI" - na tofauti na maonyesho mengi katika aina hii, huendesha miundo halisi ya utayarishaji na uzani wao halisi kwenye kadi halisi ambayo wapenzi wanaweza kusoma mwisho hadi mwisho.

Mradi unauliza maswali mawili, kwa maneno ya README yake yenyewe: mawakala wa AI wanaweza kwenda umbali gani katika muundo wa maunzi, na wanaweza kuunda chip inayoendesha makisio yao wenyewe? Swali la pili ni la uchochezi. Mfumo wa AI unaounda silicon - au katika kesi hii, mkondo wa FPGA - ambao hutengeneza tokeni zake ni kitanzi ambacho kinanasa haswa wazo la tasnia linapoelekea. For more context on this story, see our ongoing AI trends.

Ni Nini Kinachoendelea Kwenye Kadi

Lengwa la maunzi si la kuvutia kwa viwango vya kituo cha data: kadi ya Inspur YPCB-00338 iliyojengwa karibu na Xilinx Kintex-7 xc7k480t FPGA yenye chaneli mbili za DDR3 na kipimo data cha kilele cha 17.1 GB/s. Hiyo ni mbali na kiongeza kasi kilichopangwa kwa HBM, ambacho hufanya matokeo kuvutia zaidi, sio kidogo.

Kulingana na vipimo vilivyochapishwa vya mradi, muundo huo unaendesha mifano kumi ya kisasa ya wazi na uzani wao halisi. LFM2.5-230M hutenga misimbo kwa tokeni 59 kwa sekunde katika int8 na tokeni 85.8 kwa sekunde katika 4-bit. Qwen3-0.6B inadhibiti tokeni 21.6 kwa sekunde, huku miundo mikubwa ikishuka kama inavyotarajiwa: SmolLM3-3B kwa tokeni 5 kwa int8 ya sekunde, Phi-4-mini (3.8B) 4, na Qwen3.5-4B kwa tokeni 5.9 kwa sekunde 4-bit. Gemma 4 E2B na E4B pia huendesha, na kuweka meza zao za upachikaji za kila safu zikikaa kwenye kadi.

Timu ilienda mbali zaidi na miundo mchanganyiko ya wataalam ambayo inazidi GiB 4 za DRAM za kadi. LFM2.5-8B-A1B — Vigezo bilioni 8.5 vilivyo na bilioni 1.7 - hutengana kwa tokeni 10.6 kwa sekunde kwa wataalam wa utiririshaji kutoka kwa hifadhi ya seva pangishi, huku asilimia 98.5 ya wataalam wanatumia kupiga nafasi kwenye kadi na MB 5.2 pekee huhamishwa kwa kila tokeni. Qwen3.5-35B-A3B inaendeshwa kwa tokeni 3.95 kwa sekunde huku ikitiririsha MB 153 kwa tokeni kupitia PCIe. Kila usanidi, README inasema, inalingana na tokeni ya kiigaji cha mradi - madai ya ukweli kidogo ambayo wadukuzi wa maunzi watatambua kama sehemu ngumu ya kazi.

Imejengwa Kama Mradi Halisi wa Silicon

Kinachotenganisha openTPU na demo za kawaida za FPGA ni utimilifu wa rafu. Monorepo ina muundo wa maunzi wa SystemVerilog, seti maalum ya maagizo, kiigaji cha usahihi zaidi, lugha ya kernel iliyo na kikusanyaji chake, na programu ya seva pangishi inayoendesha kadi ya PCIe, ikijumuisha matumizi ya ufuatiliaji wa otpu-smi katika roho ya nvidia-smi na onyesho la otpu-chat.

Picha ya uzalishaji hutumia safu wima nne ya kitengo cha matrix ya sistoli na injini ya mtiririko katika 133.33 MHz, na vidhibiti vya kumbukumbu vya LiteDRAM vilivyosawazishwa na CPU ndogo ndani ya msingi wa kumbukumbu - kadi husawazisha chaneli zote mbili za DDR3 katika sekunde 12 bila kuhusika kwa mwenyeji. Muundo wa sasa, uliotumika tangu Oktoba 1, hutenganisha miundo kadhaa kwa kasi ya asilimia 8 hadi 10 kuliko picha ya awali huku ikisukuma matumizi ya DRAM hadi asilimia 91-94 ya kilele.

Mradi pia unaandika umbizo la uzani wa biti 4 lililojengwa kwa thamani za FP4 na mizani ya kuzuia ngazi mbili kwa biti 4.25 kwa kila uzani, ikiweka kichwa cha modeli ya lugha katika int8 kwa usahihi. Umbizo hupunguza baiti kwa kila tokeni kwa takriban theluthi moja na kuinua kasi ya kusimbua kwa asilimia 40 hadi 45 kwenye baadhi ya miundo.

README inathamini mbinu ya mradi kwa masomo kutoka kwa hazina ya awali, mashindano ya kiotomatiki, ambayo yalichunguza utafutaji wa usanifu wa maunzi unaoendeshwa na AI. openTPU ni matumizi ya njia hiyo kwa kiongeza kasi kamili, na muundo wa mawakala umeidhinishwa dhidi ya kiigaji kabla ya kugusa maunzi.

Kwanini Ni Muhimu

Utendaji hapa hautasumbua Nvidia. Kintex-7 na DDR3 ni darasa la miaka kumi la vifaa, na mifano inayoendesha ni ndogo. Lakini hilo ndilo jambo ambalo mradi hutoa kwa uwazi: kiongeza kasi kizima - RTL, seti ya maagizo, kiigaji, kikusanyaji, na mrundikano wa mwenyeji - kinaweza kusomeka kwa mtu mmoja, katika hazina moja, na kiliundwa angalau kwa sehemu na mawakala wa AI badala ya timu ya maunzi.

Mikondo mitatu inaungana katika wazo hilo. Kwanza, vifaa vya AI vya chanzo-wazi vimeathiriwa kwa muda mrefu na upana wa utaalamu unaohitajika; mtiririko wa muundo unaoendeshwa na wakala hupunguza kizuizi hicho. Pili, hitaji la uelekezaji linasukuma watafiti kuelekea maunzi ya kusudi maalum ya kigeni, na utaftaji wa muundo wa kiotomatiki unafaa kwa kugundua nafasi hiyo. Tatu, pembe ya kujipangisha yenyewe - AI kujenga mashine inayoendesha - imekuwa ishara ambayo jamii inaitazama kwa karibu, kwa kuzingatia kupanda kwa kasi kwa mradi kwenye Habari za Hacker, ambapo ilikusanya zaidi ya alama 150 ndani ya masaa.

Hifadhi iliundwa mnamo Septemba 24 na kupokea toleo lake la hivi punde mnamo Oktoba 2, na matokeo yaliyopimwa yaliwekwa majuzi kama Oktoba 1 - kasi ya ukuzaji inayofaa kutazamwa yenyewe. Kwa mtu yeyote ambaye anataka kuelewa jinsi kiongeza kasi cha AI kinavyofanya kazi kutoka kwa tumbo kuzidisha kwenye Python hadi waya, muundo wa mradi wenyewe ni sahihi: jambo zima linaishi katika monorepo moja ndogo unaweza kusoma mwisho hadi mwisho.

Iwe maunzi yaliyoundwa na wakala yanakuwa niche kubwa au yanasalia kuwa shauku ya utafiti, openTPU imeonyesha jambo fulani thabiti: zana zinazoruhusu miundo ya AI kuandika programu sasa zimetoa mfumo wa maunzi unaofanya kazi, ulioidhinishwa ambao unaendesha miundo hiyo hiyo. Kitanzi kimefungwa, angalau kwa kiwango cha FPGA.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →