Proyek cilik nanging nggumunake nyebar ing Hacker News minggu iki: openTPU, akselerator AI open-source sing desain hardware dhewe diprodhuksi dening agen AI. Repositori kasebut, sing diterbitake ing lisensi Apache 2.0 ing GitHub, nggambarake apa sing diarani penulis minangka "akselerator AI open-source, dikembangake dening AI" - lan ora kaya demo paling akeh ing genre iki, model produksi nyata kanthi bobot nyata ing kertu fisik sing para penggemar bisa sinau nganti pungkasan.

Proyèk iki takon loro pitakonan, ing tembung saka README dhewe: carane adoh agen AI bisa pindhah ing desain hardware, lan padha bisa mbangun chip sing nganggo inferensi dhewe? Pitakonan kapindho yaiku pitakonan provokatif. Sistem AI sing ngrancang silikon - utawa ing kasus iki, bitstream FPGA - sing ngasilake token dhewe minangka daur ulang sing njupuk persis ing endi imajinasi industri kasebut. For more context on this story, see our ongoing more AI stories.

Apa Bener mlaku ing Card

Sasaran hardware ora nyenengake kanthi standar pusat data: kertu Inspur YPCB-00338 sing dibangun ing sekitar Xilinx Kintex-7 xc7k480t FPGA kanthi rong saluran DDR3 lan bandwidth memori puncak 17,1 GB / s. Sing adoh saka akselerator sing ditumpuk HBM, sing ndadekake asil luwih menarik, ora kurang.

Miturut pangukuran sing diterbitake proyek kasebut, desain kasebut nganggo sepuluh model mbukak modern kanthi bobot nyata. LFM2.5-230M decode ing 59 token per detik ing int8 lan 85.8 token per detik ing 4-dicokot. Qwen3-0.6B ngatur 21,6 token per detik, nalika model luwih gedhe ukuran mudhun kaya samesthine: SmolLM3-3B ing 5 token per detik int8, Phi-4-mini (3.8B) ing 4, lan Qwen3.5-4B ing 5,9 token per detik ing 4-dicokot. Gemma 4 E2B lan E4B uga mbukak, tetep tabel embedding saben lapisan ing kertu.

Tim kasebut luwih maju kanthi model campuran ahli sing ngluwihi kertu 4 GiB DRAM. LFM2.5-8B-A1B - 8,5 milyar paramèter karo 1,7 milyar aktif - decode ing 10,6 token per detik dening ahli streaming saka panyimpenan inang, karo 98,5 persen pakar nggunakake mencet slot ing kertu lan mung 5,2 MB ditransfer saben token. Qwen3.5-35B-A3B mlaku ing 3,95 token per detik nalika streaming 153 MB saben token liwat PCIe. Saben konfigurasi, negara README, cocog karo token simulator proyek kanggo token - pratelan sing akurat banget yen peretas hardware bakal ngerteni minangka bagian sing angel ing proyek kasebut.

Dibangun Kaya Proyek Silikon Nyata

Sing misahake openTPU saka demo FPGA hobi khas yaiku kelengkapan tumpukan. Monorepo ngemot desain hardware SystemVerilog, pesawat instruksi khusus, simulator bit-tepat, basa kernel karo compiler dhewe, lan piranti lunak inang sing drive kertu PCIe, kalebu sarana ngawasi otpu-smi ing semangat nvidia-smi lan demo otpu-chat.

Gambar produksi nganggo unit matriks sistolik papat kolom lan mesin stream ing 133,33 MHz, karo pengontrol memori LiteDRAM sing dikalibrasi dening CPU cilik ing inti memori - kertu calibrates loro saluran DDR3 ing 12 detik tanpa keterlibatan host. Mbangun saiki, disebarake wiwit 1 Oktober, decodes sawetara model 8 kanggo 10 persen luwih cepet saka gambar sadurunge nalika meksa nindakake perkara DRAM kanggo 91-94 persen saka puncak.

Proyèk iki uga nyathet format bobot 4-bit sing dibangun ing nilai FP4 kanthi timbangan blok rong tingkat kanthi 4,25 bit saben bobot, njaga kepala model basa ing int8 kanggo akurasi. Format kasebut ngethok bita saben token kanthi kira-kira katelu lan ngangkat kacepetan decode nganti 40 nganti 45 persen ing sawetara model.

README menehi kredit pendekatan proyek kanggo pelajaran saka repositori sadurunge, turnamen lengkungan otomatis, sing njelajah telusuran arsitektur hardware sing didorong AI. openTPU minangka aplikasi metode kasebut menyang akselerator lengkap, kanthi desain agen divalidasi marang simulator sadurunge ndemek hardware.

Apa Sing Penting

Kinerja ing kene ora bakal ngganggu Nvidia. A Kintex-7 karo DDR3 iku kelas dasawarsa-lawas saka hardware, lan model nganggo cilik. Nanging sing dadi titik proyek kasebut kanthi implisit: kabeh akselerator - RTL, set instruksi, simulator, compiler, lan tumpukan host - bisa diwaca kanggo wong siji, ing siji gudang, lan dirancang paling ora sebagian dening agen AI tinimbang tim hardware.

Telung arus konvergen ing ide kasebut. Kaping pisanan, hardware AI open-source wis suwe diganggu dening keahlian sing dibutuhake; aliran desain agen-mimpin lowers alangi sing. Kapindho, panjaluk inferensi nyurung peneliti menyang piranti keras tujuan khusus sing eksotis, lan telusuran desain otomatis cocog kanggo njelajah papan kasebut. Katelu, sudut hosting dhewe - AI sing nggawe mesin sing digunakake - wis dadi sinyal sing ditonton kanthi rapet dening komunitas, adhedhasar kenaikan cepet proyek kasebut ing Hacker News, sing nglumpukake luwih saka 150 poin sajrone sawetara jam.

Repositori kasebut digawe ing 24 September lan nampa push paling anyar ing 2 Oktober, kanthi asil sing diukur tanggal 1 Oktober - jangkah pangembangan sing kudu ditonton dhewe. Kanggo sapa wae sing pengin ngerti carane akselerator AI bisa saka multiply matriks ing Python mudhun kanggo kabel, framing project dhewe akurat: kabeh urip ing siji monorepo cilik sampeyan bisa maca pungkasan.

Apa hardware sing dirancang agen dadi ceruk serius utawa tetep dadi penasaran riset, openTPU wis nuduhake soko konkrit: alat sing ngidini model AI nulis piranti lunak saiki wis ngasilake sistem hardware sing bisa digunakake lan diverifikasi sing nganggo model sing padha. Daur ulang ditutup, paling sethithik ing skala FPGA.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →