今週、小さいながらも印象的なプロジェクトが Hacker News で広まりました。openTPU は、ハードウェア設計自体が AI エージェントによって作成されたオープンソース AI アクセラレータです。 GitHub で Apache 2.0 ライセンスに基づいて公開されているこのリポジトリでは、作成者が「AI によって開発されたオープンソース AI アクセラレータ」と呼ぶものについて説明しています。このジャンルのほとんどのデモとは異なり、愛好家がエンドツーエンドで学習できる物理カード上の実際の重みを使用して実際の実稼働モデルを実行します。
プロジェクト自体の README の言葉によれば、このプロジェクトは 2 つの質問をしています。それは、AI エージェントがハードウェア設計でどこまでできるのか、そして独自の推論を実行するチップを構築できるのかということです。 2 番目の質問は挑発的なものです。独自のトークンを生成するシリコン (この場合は FPGA ビットストリーム) を設計する AI システムは、業界の想像力がどこに向かっているのかを正確に捉えるループです。 この件の詳細は、AIの最新動向をご覧ください。
カード上で実際に実行されるもの
ハードウェア ターゲットは、データセンター標準からすると地味なものです。Inspur YPCB-00338 カードは、2 つの DDR3 チャネルと 17.1 GB/秒のピーク メモリ帯域幅を備えた Xilinx Kintex-7 xc7k480t FPGA を中心に構築されています。これは、HBM スタック型アクセラレータとは大きく異なり、その結果、興味深い結果が得られるわけではありません。
プロジェクトが公開した測定結果によると、この設計では 10 個の最新のオープン モデルが実際の重みで実行されます。 LFM2.5-230M は、int8 で 1 秒あたり 59 トークン、4 ビットで 1 秒あたり 85.8 トークンでデコードします。 Qwen3-0.6B は 1 秒あたり 21.6 トークンを管理しますが、より大きなモデルは予想通りスケールダウンします。SmolLM3-3B は 5 トークン/秒 int8、Phi-4-mini (3.8B) は 4、Qwen3.5-4B は 4 ビットで 5.9 トークン/秒です。 Gemma 4 E2B および E4B も実行され、レイヤーごとの埋め込みテーブルがカード上に常駐します。
チームはさらに、カードの 4 GiB の DRAM を超える専門家混合モデルを開発しました。 LFM2.5-8B-A1B — 85 億パラメータ、17 億アクティブ — ホスト ストレージからストリーミング エキスパートによって 1 秒あたり 10.6 トークンでデコードされ、エキスパート使用の 98.5 パーセントがカード上のスロットにヒットし、トークンごとに転送されるのはわずか 5.2 MB です。 Qwen3.5-35B-A3B は、PCIe 経由でトークンあたり 153 MB をストリーミングしながら、1 秒あたり 3.95 トークンで実行します。 README には、すべての構成がプロジェクトのシミュレーター トークンとトークンごとに一致していると記載されています。これは、ハードウェア ハッカーが仕事の難しい部分として認識するビット精度の主張です。
本物のシリコンプロジェクトのように構築
openTPU と一般的な趣味の FPGA デモの違いは、スタックの完全性です。モノリポジトリには、SystemVerilog ハードウェア設計、カスタム命令セット、ビット正確なシミュレータ、独自のコンパイラを備えたカーネル言語、および nvidia-smi の精神に基づく otpu-smi 監視ユーティリティや otpu-chat デモを含む、PCIe カードを駆動するホスト ソフトウェアが含まれています。
製品イメージは、4 カラムのシストリック マトリックス ユニットと 133.33 MHz のストリーム エンジンを実行し、メモリ コア内の小型 CPU によって校正された LiteDRAM メモリ コントローラを備えています。このカードは、ホストの介入なしに両方の DDR3 チャネルを 12 秒で校正します。 10 月 1 日から導入された現在のビルドは、DRAM 使用率をピークの 91 ~ 94 パーセントに押し上げながら、以前のイメージよりも 8 ~ 10 パーセント速くいくつかのモデルをデコードします。
このプロジェクトでは、重みあたり 4.25 ビットの 2 レベルのブロック スケールを備えた FP4 値に基づいて構築された 4 ビット重みフォーマットも文書化されており、精度を高めるために言語モデルの頭部を int8 に保ちます。この形式により、トークンあたりのバイト数が約 3 分の 1 に削減され、一部のモデルではデコード速度が 40 ~ 45 パーセント向上します。
README では、このプロジェクトのアプローチは、AI 主導のハードウェア アーキテクチャ検索を検討した以前のリポジトリである auto-arch-tournament からの教訓に基づいているとされています。 openTPU は、そのメソッドを完全なアクセラレータに適用したもので、エージェントの設計はハードウェアに触れる前にシミュレータに対して検証されます。
なぜそれが重要なのか
ここでのパフォーマンスは Nvidia に迷惑をかけることはありません。 DDR3 を搭載した Kintex-7 は 10 年前からあるクラスのハードウェアであり、動作するモデルは小規模です。しかし、それがプロジェクトが暗黙のうちに主張している点です。アクセラレータ全体 (RTL、命令セット、シミュレーター、コンパイラー、ホスト スタック) は、1 人のリポジトリ内で 1 人が判読でき、少なくとも部分的にはハードウェア チームではなく AI エージェントによって設計されています。
その考えには3つの流れが収束する。まず、オープンソースの AI ハードウェアは、必要とされる広範な専門知識によって長い間妨げられてきました。エージェント主導の設計フローにより、その障壁が低くなります。第 2 に、推論の需要により、研究者は珍しい特殊用途のハードウェアに向かうようになっており、自動化された設計検索はその領域を探索するのに自然に適合します。第三に、自己ホスティングの観点、つまり AI が動作するマシンを構築するという点は、このプロジェクトが Hacker News で急速に上昇し、数時間以内に 150 以上のポイントを集めたことから判断すると、コミュニティが注意深く監視しているシグナルとなっています。
このリポジトリは 9 月 24 日に作成され、10 月 2 日に最新のプッシュが行われ、測定結果の日付は 10 月 1 日と最近のもので、この開発ペースはそれ自体注目に値します。 Python での行列乗算からワイヤーに至るまで AI アクセラレータがどのように機能するかを理解したい人にとって、プロジェクト自体の枠組みは正確です。すべてが 1 つの小さなモノリポジトリ内に存在し、エンドツーエンドで読むことができます。
エージェント設計のハードウェアが深刻なニッチ分野になるか、研究の好奇心のままであるかにかかわらず、openTPU は具体的なことを実証しました。AI モデルにソフトウェアを作成させるツールが、同じモデルを実行する、動作する検証済みのハードウェア システムを生成しました。少なくとも FPGA スケールでは、ループは閉じています。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →