Sebuah proyek kecil namun mencolok beredar di Hacker News minggu ini: openTPU, akselerator AI sumber terbuka yang desain perangkat kerasnya diproduksi sendiri oleh agen AI. Repositori tersebut, diterbitkan di bawah lisensi Apache 2.0 di GitHub, menjelaskan apa yang penulis sebut sebagai "akselerator AI sumber terbuka, yang dikembangkan oleh AI" — dan tidak seperti kebanyakan demo dalam genre ini, repositori ini menjalankan model produksi nyata dengan bobot sebenarnya pada kartu fisik yang dapat dipelajari oleh para penggemar secara menyeluruh.
Proyek ini mengajukan dua pertanyaan, menurut README-nya sendiri: seberapa jauh agen AI dapat merancang perangkat keras, dan dapatkah mereka membuat chip yang menjalankan inferensi mereka sendiri? Pertanyaan kedua adalah pertanyaan yang provokatif. Sistem AI yang merancang silikon – atau dalam hal ini, bitstream FPGA – yang menghasilkan tokennya sendiri adalah sebuah loop yang menangkap dengan tepat ke mana arah imajinasi industri. For more context on this story, see our ongoing artificial intelligence updates.
Apa yang Sebenarnya Berjalan di Kartu
Target perangkat kerasnya tidak menarik menurut standar pusat data: kartu Inspur YPCB-00338 yang dibuat dengan FPGA Xilinx Kintex-7 xc7k480t dengan dua saluran DDR3 dan bandwidth memori puncak 17,1 GB/s. Ini jauh berbeda dengan akselerator bertumpuk HBM, yang membuat hasilnya lebih menarik, bukan malah kalah.
Menurut pengukuran proyek yang dipublikasikan, desain tersebut menjalankan sepuluh model terbuka modern dengan bobot sebenarnya. LFM2.5-230M mendekode pada 59 token per detik di int8 dan 85,8 token per detik dalam 4-bit. Qwen3-0.6B mengelola 21,6 token per detik, sementara model yang lebih besar menurunkan skala seperti yang diharapkan: SmolLM3-3B dengan 5 token per detik int8, Phi-4-mini (3,8B) pada 4, dan Qwen3.5-4B dengan 5,9 token per detik dalam 4-bit. Gemma 4 E2B dan E4B juga berjalan, menjaga tabel penyematan per lapisan tetap ada di kartu.
Tim melangkah lebih jauh dengan model campuran ahli yang melebihi DRAM kartu sebesar 4 GiB. LFM2.5-8B-A1B — 8,5 miliar parameter dengan 1,7 miliar parameter aktif — didekodekan pada 10,6 token per detik oleh streaming pakar dari penyimpanan host, dengan 98,5 persen penggunaan pakar mengenai slot pada kartu dan hanya 5,2 MB yang ditransfer per token. Qwen3.5-35B-A3B berjalan pada 3,95 token per detik sambil mengalirkan 153 MB per token melalui PCIe. Setiap konfigurasi, menurut README, cocok dengan token simulator proyek untuk token — sebuah klaim ketepatan yang akan dikenali oleh peretas perangkat keras sebagai bagian tersulit dari pekerjaan tersebut.
Dibangun Seperti Proyek Silikon Asli
Yang membedakan openTPU dari demo FPGA hobi pada umumnya adalah kelengkapan tumpukannya. Monorepo berisi desain perangkat keras SystemVerilog, set instruksi khusus, simulator bit-tepat, bahasa kernel dengan kompilernya sendiri, dan perangkat lunak host yang menggerakkan kartu PCIe, termasuk utilitas pemantauan otpu-smi dalam semangat nvidia-smi dan demo otpu-chat.
Gambar produksi menjalankan unit matriks sistolik empat kolom dan mesin aliran pada 133,33 MHz, dengan pengontrol memori LiteDRAM yang dikalibrasi oleh CPU kecil di dalam inti memori — kartu tersebut mengkalibrasi kedua saluran DDR3 dalam 12 detik tanpa keterlibatan host. Versi saat ini, yang diterapkan sejak 1 Oktober, menerjemahkan beberapa model 8 hingga 10 persen lebih cepat dibandingkan gambar sebelumnya sekaligus mendorong pemanfaatan DRAM hingga puncaknya 91-94 persen.
Proyek ini juga mendokumentasikan format bobot 4-bit yang dibangun berdasarkan nilai FP4 dengan skala blok dua tingkat pada 4,25 bit per bobot, menjaga kepala model bahasa di int8 untuk akurasi. Format ini memotong byte per token sekitar sepertiganya dan meningkatkan kecepatan dekode sebesar 40 hingga 45 persen pada beberapa model.
README memuji pendekatan proyek ini berdasarkan pembelajaran dari repositori sebelumnya, auto-arch-tournament, yang mengeksplorasi pencarian arsitektur perangkat keras berbasis AI. openTPU adalah penerapan metode tersebut pada akselerator lengkap, dengan desain agen divalidasi terhadap simulator sebelum menyentuh perangkat keras.
Mengapa Itu Penting
Performa di sini tidak akan menyusahkan Nvidia. Kintex-7 dengan DDR3 adalah kelas perangkat keras berusia satu dekade, dan model yang dijalankannya berukuran kecil. Namun hal tersebut secara implisit disampaikan oleh proyek ini: seluruh akselerator — RTL, set instruksi, simulator, kompiler, dan tumpukan host — dapat dibaca oleh satu orang, dalam satu repositori, dan dirancang setidaknya sebagian oleh agen AI, bukan oleh tim perangkat keras.
Tiga arus bertemu dalam gagasan itu. Pertama, perangkat keras AI sumber terbuka telah lama terhambat oleh banyaknya keahlian yang dibutuhkan; aliran desain yang digerakkan oleh agen menurunkan hambatan tersebut. Kedua, permintaan inferensi mendorong para peneliti untuk menggunakan perangkat keras dengan tujuan khusus yang eksotis, dan pencarian desain otomatis merupakan pilihan yang tepat untuk menjelajahi ruang tersebut. Ketiga, sudut pandang self-hosting – AI yang membangun mesin yang menjalankannya – telah menjadi sinyal yang diwaspadai oleh komunitas, dilihat dari peningkatan pesat proyek ini di Hacker News, yang mengumpulkan lebih dari 150 poin dalam beberapa jam.
Repositori ini dibuat pada tanggal 24 September dan menerima dorongan terbarunya pada tanggal 2 Oktober, dengan hasil terukur paling lambat tanggal 1 Oktober — sebuah langkah pengembangan yang layak untuk diperhatikan. Bagi siapa pun yang ingin memahami cara kerja akselerator AI mulai dari perkalian matriks dengan Python hingga ke kabel, kerangka proyek ini akurat: semuanya ada dalam satu monorepo kecil yang dapat Anda baca ujung ke ujung.
Apakah perangkat keras yang dirancang oleh agen menjadi topik yang serius atau tetap menjadi penelitian yang menarik, openTPU telah menunjukkan sesuatu yang konkret: alat yang memungkinkan model AI menulis perangkat lunak kini telah menghasilkan sistem perangkat keras yang berfungsi dan terverifikasi yang menjalankan model yang sama. Loopnya tertutup, setidaknya pada skala FPGA.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →