Projek kecil tetapi menarik sedang diedarkan di Berita Hacker minggu ini: openTPU, pemecut AI sumber terbuka yang reka bentuk perkakasannya sendiri dihasilkan oleh ejen AI. Repositori, yang diterbitkan di bawah lesen Apache 2.0 di GitHub, menerangkan apa yang pengarangnya panggil "pemecut AI sumber terbuka, dibangunkan oleh AI" — dan tidak seperti kebanyakan demo dalam genre ini, ia menjalankan model pengeluaran sebenar dengan pemberat sebenar mereka pada kad fizikal yang peminat boleh belajar hujung ke hujung.
Projek itu bertanya dua soalan, dalam kata-kata READMEnya sendiri: sejauh mana ejen AI boleh pergi pada reka bentuk perkakasan, dan bolehkah mereka membina cip yang menjalankan inferens mereka sendiri? Soalan kedua ialah soalan provokasi. Sistem AI yang mereka bentuk silikon — atau dalam kes ini, aliran bit FPGA — yang menjana tokennya sendiri ialah gelung yang menangkap dengan tepat ke mana imaginasi industri menuju. For more context on this story, see our ongoing breaking AI news.
Perkara Sebenarnya Berfungsi pada Kad
Sasaran perkakasan adalah tidak menarik mengikut piawaian pusat data: kad Inspur YPCB-00338 yang dibina di sekeliling Xilinx Kintex-7 xc7k480t FPGA dengan dua saluran DDR3 dan lebar jalur memori puncak 17.1 GB/s. Itu jauh berbeza daripada pemecut bertindan HBM, yang menjadikan hasilnya lebih menarik, tidak kurang.
Menurut ukuran yang diterbitkan projek itu, reka bentuk menjalankan sepuluh model terbuka moden dengan berat sebenar mereka. LFM2.5-230M menyahkod pada 59 token sesaat dalam int8 dan 85.8 token sesaat dalam 4-bit. Qwen3-0.6B mengurus 21.6 token sesaat, manakala model yang lebih besar mengecil seperti yang dijangkakan: SmolLM3-3B pada 5 token sesaat int8, Phi-4-mini (3.8B) pada 4 dan Qwen3.5-4B pada 5.9 token sesaat dalam 4-bit. Gemma 4 E2B dan E4B juga berjalan, mengekalkan jadual benam setiap lapisan mereka pada kad.
Pasukan pergi lebih jauh dengan model campuran pakar yang melebihi 4 GiB DRAM kad. LFM2.5-8B-A1B — 8.5 bilion parameter dengan 1.7 bilion aktif — dinyahkod pada 10.6 token sesaat oleh pakar penstriman daripada storan hos, dengan 98.5 peratus pakar menggunakan menekan slot pada kad dan hanya 5.2 MB dipindahkan setiap token. Qwen3.5-35B-A3B berjalan pada 3.95 token sesaat sambil menstrim 153 MB setiap token melalui PCIe. Setiap konfigurasi, README menyatakan, sepadan dengan token simulator projek untuk token — dakwaan ketepatan sedikit bahawa penggodam perkakasan akan mengenali sebagai bahagian yang sukar dalam kerja.
Dibina Seperti Projek Silikon Sebenar
Apa yang membezakan openTPU daripada demo FPGA hobi biasa ialah kesempurnaan timbunan. Monorepo mengandungi reka bentuk perkakasan SystemVerilog, set arahan tersuai, simulator bit-tepat, bahasa kernel dengan pengkompilnya sendiri dan perisian hos yang memacu kad PCIe, termasuk utiliti pemantauan otpu-smi dalam semangat nvidia-smi dan demo otpu-chat.
Imej pengeluaran menjalankan unit matriks sistolik empat lajur dan enjin strim pada 133.33 MHz, dengan pengawal memori LiteDRAM yang ditentukur oleh CPU kecil di dalam teras memori — kad menentukur kedua-dua saluran DDR3 dalam 12 saat tanpa penglibatan hos. Binaan semasa, yang digunakan sejak 1 Oktober, menyahkod beberapa model 8 hingga 10 peratus lebih pantas daripada imej sebelumnya sambil menolak penggunaan DRAM kepada 91-94 peratus daripada puncak.
Projek ini juga mendokumenkan format berat 4-bit yang dibina pada nilai FP4 dengan skala blok dua peringkat pada 4.25 bit setiap berat, mengekalkan kepala model bahasa dalam int8 untuk ketepatan. Format memotong bait setiap token sebanyak kira-kira satu pertiga dan meningkatkan kelajuan penyahkod sebanyak 40 hingga 45 peratus pada sesetengah model.
README mengkreditkan pendekatan projek kepada pelajaran daripada repositori terdahulu, auto-arch-tournament, yang meneroka carian seni bina perkakasan dipacu AI. openTPU ialah aplikasi kaedah itu kepada pemecut yang lengkap, dengan reka bentuk ejen disahkan terhadap simulator sebelum menyentuh perkakasan.
Mengapa Ia Penting
Prestasi di sini tidak akan menyusahkan Nvidia. Kintex-7 dengan DDR3 ialah kelas perkakasan yang berusia sedekad, dan model yang dikendalikannya adalah kecil. Tetapi itulah perkara yang dibuat oleh projek secara tersirat: keseluruhan pemecut - RTL, set arahan, simulator, pengkompil, dan timbunan hos - boleh dibaca oleh satu orang, dalam satu repositori, dan ia direka bentuk sekurang-kurangnya sebahagiannya oleh ejen AI dan bukannya pasukan perkakasan.
Tiga arus berkumpul dalam idea itu. Pertama, perkakasan AI sumber terbuka telah lama terhalang oleh keluasan kepakaran yang diperlukan; aliran reka bentuk yang didorong oleh ejen merendahkan halangan itu. Kedua, permintaan inferens mendorong penyelidik ke arah perkakasan tujuan khas eksotik, dan carian reka bentuk automatik adalah wajar untuk meneroka ruang tersebut. Ketiga, sudut pengehosan sendiri — AI membina mesin yang digunakannya — telah menjadi isyarat yang diperhatikan oleh komuniti dengan teliti, berdasarkan peningkatan pesat projek itu di Hacker News, di mana ia mengumpul lebih daripada 150 mata dalam beberapa jam.
Repositori itu dibuat pada 24 September dan menerima dorongan terbarunya pada 2 Oktober, dengan hasil terukur bertarikh baru-baru ini pada 1 Oktober — kadar pembangunan yang patut ditonton dengan sendirinya. Bagi sesiapa yang ingin memahami cara pemecut AI berfungsi daripada matriks darab dalam Python hingga ke wayar, pembingkaian projek itu sendiri adalah tepat: semuanya hidup dalam satu monorepo kecil yang boleh anda baca hujung ke hujung.
Sama ada perkakasan yang direka bentuk ejen menjadi niche yang serius atau kekal sebagai rasa ingin tahu penyelidikan, openTPU telah menunjukkan sesuatu yang konkrit: alatan yang membenarkan model AI menulis perisian kini telah menghasilkan sistem perkakasan yang berfungsi dan disahkan yang menjalankan model yang sama. Gelung ditutup, sekurang-kurangnya pada skala FPGA.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →