オープンソース プロジェクトは、2,890 万パラメータの言語モデルを約 8 ドルのマイクロコントローラーに詰め込み、ネットワーク接続をまったく行わずに、チップ上で 1 秒あたり約 9 トークンの速度でテキスト全体を生成します。このデモンストレーションは GitHub で公開され、Hacker News のトップページに急速に掲載されており、小規模なローカル AI のフロンティアがほんの短期間でどれほど遠くまで進んだかを示しています。
この研究は、愛好家やハードウェア メーカーに人気のある安価な組み込みチップである ESP32-S3 を中心に行っています。このような小さなシリコン上で 2,890 万のパラメータ モデルを実行することは、少し前までは信じられないことだと思われていたでしょう。このプロジェクトは、私たちが日々の AI 業界報道 で追跡しているオンデバイス AI への広範な推進を鮮明に示しています。かつては実際の言語モデルにはクラウドが必須であると考えられていましたが、ますます高性能なシステムがエッジに居場所を見つけています。
ビルドの背後にある数字
プロジェクトはその仕様を明確に示しています。このモデルには 2,890 万個のパラメータが保存されており、そのうち約 2,500 万個がフラッシュ ルックアップ テーブル内に存在します。 512KBの高速SRAM、8MBのPSRAM、16MBのフラッシュストレージを備えたESP32-S3チップ上で動作します。実際には、エンドツーエンドでは 1 秒あたり約 9.5 トークン、または純粋な計算では 1 秒あたり 9.7 トークンに達し、4 ビット精度で保存した場合、モデル全体が占めるのはわずか 14.9 メガバイトです。
最も印象的なのは、著者が以前の作品と比較していることです。このクラスのチップ上で動作することが知られている最後の言語モデルは、260,000 個のパラメータしか保持していませんでした。新しいビルドはおよそ 100 倍以上の容量を保持できますが、これはチップの大型化によるものではなく、モデルのデータが実際に存在する場所を再考した結果によるものです。
ジェマから借りた記憶術
中心的な問題は、マイクロコントローラーには高速メモリがほとんどないことです。 ESP32-S3 が提供する SRAM はわずか 512KB であり、従来はそこからモデル全体にアクセスできる必要がありました。そのため、以前の試みは数十万のパラメーターで止まっていました。
回避策は簡単な観察に基づいています。言語モデルのパラメーターのほとんどは埋め込みテーブル内にあり、モデルは計算ではなくそこから読み取ります。そのため、プロジェクトでは、その巨大な 2,500 万行のテーブルを希少な高速メモリに強制的に格納するのではなく、低速のフラッシュ ストレージに残し、各トークンが実際に必要とする数行のみ (一度に約 450 バイト) を取得します。実際の計算を実行するモデルのごく一部は高速メモリに残りますが、重みの大部分はフラッシュ内で待機し、一度に少しずつサンプリングされます。
この技術はレイヤーごとの埋め込みとして知られており、Google の Gemma モデル、具体的には携帯電話と GPU 向けに設計された Gemma 3n と Gemma 4 に由来します。プロジェクトの作成者によると、これほど小さなチップでこのアプローチを試した人はこれまで誰もいなかったという。
できること、できないこと
このモデルは、単純な童話のデータセットである TinyStories でトレーニングされたため、その機能は意図的に限定されています。短く、ほとんど一貫した物語を書きますが、事実に関する質問に答えたり、複雑な指示に従ったり、コードを書いたり、世界について推論したりすることはありません。著者は、この制限はモデルの小さな推論部分に起因しており、記憶トリックによって変更されるものではないことを率直に述べています。
したがって、プロジェクトを興味深いものにしているのは、出力の品質ではなく、そのアーキテクチャです。この成果は、これほど大きなモデルをこれほど小さなチップに適合させたことで、電話機やサーバーの効率的なモデルを強化する同じ技術を、サンドイッチよりも安価なハードウェアにまで適用できることを証明しました。
オンデバイス AI が重要な理由
その影響は、単なる技術的なデモをはるかに超えています。モデルは完全にチップ上で実行されるため、サーバーには何も送信されません。つまり、完全なプライバシーが構築され、デバイスからデータが流出することはなく、クラウド料金を支払う必要もありません。遠隔地でのアプリケーション、低電力デバイス、または接続が信頼できない環境では、この組み合わせは非常に役立ちます。
また、小規模で特殊なモデルが、少数の巨大なデータセンターに集中するのではなく、数十億の安価な組み込みデバイスに分散される未来も示しています。ラップトップや携帯電話上のローカル AI への関心を高めるのと同じプレッシャー、つまり低遅延、低コスト、強力なプライバシーが、マイクロコントローラー スケールではさらに強力に適用されます。
いじくり回しへのオープンな招待状
このプロジェクトは寛容な MIT ライセンスの下でリリースされており、作成者は詳細なドキュメントとベンチマーク結果とともに完全なコードを GitHub で共有しています。このオープン性は、他のハードウェア開発者がそのアプローチを研究し、他のチップに適応させたり、パラメーター数をさらに増やすことができることを意味します。
slvDev というハンドル名でリリースされたこの作品は、開発者コミュニティに強く反響を呼び、Hacker News で数百の賛成票を集め、この技術が次にどこに広まるかについての議論を促しました。この傾向が続くとすれば、「言語モデル」と通常の組み込みソフトウェアとの間の境界線は大幅に曖昧になりつつある。
AI の先を行く
8 ドルのチップから数十億ドルのデータセンターに至るまで、AI がどこで実行されるかという問題は、AI に何ができるかということと同じくらい重要になってきています。ハードウェア層は、ほとんどの人が認識しているよりも速く進化しており、今日は珍品のように見えるプロジェクトが、明日の主流を定義することがよくあります。 AI Buzz Wire で AI ニュースの続きを読む では、エッジ コンピューティング、モデルの効率性、オンデバイス インテリジェンスのあらゆる画期的な進歩を追跡します。
AI ハードウェア革命の最新情報を入手 — AI Buzz Wire をご覧ください


