Strata と呼ばれるあまり知られていないオープンソース プロジェクトが絶好調です。この MIT ライセンスのエンジンは、アリババの Qwen3.8-Flash-Next (1,250 億パラメータの専門家混合モデル) を通常のゲーム PC 上で実行し、10 月 4 日に 640 ポイント以上を獲得して Hacker News の一面を飾り、その GitHub リポジトリは 9 月 24 日に作成されて以来、11,000 を超えるスターを集めています。
ピッチは単純です。通常はサーバー上に存在する 1,250 億パラメータのモデルは、マシンから何も出ることなく、チャット、コードの作成、画像の読み取り、コーディング エージェントの駆動を完全にコンシューマ グラフィック カード上で行うことができます。
Strata が実際に行うこと
Strata は、Windows および Linux 用の推論エンジンであると同時に、ワンクリック インストーラーでもあります。そのドキュメントによると、要件はフロンティア モデルの標準からすると控えめです。NVIDIA の RTX 20、30、40、または 50 シリーズまたは AMD の Radeon RX 6000、7000、または 9000 シリーズの少なくとも 12 GB の VRAM を搭載した GPU、少なくとも 32 GB のシステム RAM、およびおよそ 80 GB の SSD 空き容量。
このエンジンは、Q2_0 から IQ3_S までのいくつかの圧縮レベルで量子化された Qwen3.8-Flash-Next バージョンと、コードに特化したバージョンを出荷します。 OpenAI と Anthropic 互換の API をローカルホスト上で公開します。つまり、ChatGPT または Claude 用に構築されたツール (Claude Code、Cursor、Codex などのコーディング エージェントを含む) を最小限の変更でローカル サーバーに向けることができます。オプションの画像入力とマルチ GPU サポートが含まれており、インストーラーには AI 支援セットアップ モードも用意されており、コーディング アシスタントが単一の貼り付けられたプロンプトからマシンを構成できるようになります。
速度の数値
このプロジェクトが公開したベンチマークは、消費者向けデスクトップ 2 台で測定されたもので、リリースが広まった理由となっています。 12 GB の VRAM を搭載した NVIDIA RTX 5070 と、Ryzen 5 7600 および 64 GB の RAM を組み合わせた場合、Strata は次のように報告しています。
- Q2_0 量子化: 32K トークンのドキュメントの生成には 1 秒あたり 94 トークン、プロンプト処理には 1 秒あたり 2,650 トークン
- IQ3_S: 1 秒あたり 53 トークン生成、1 秒あたり 1,620 トークンのプロンプト処理
- コーダーのバリアント: 2 世代あたり 55 トークン
AMD 側では、16 GB の VRAM を搭載した RX 9070 XT が Q2_0 で 1 秒あたり 60 トークンを管理しました。ドキュメントによると、24 GB の VRAM を搭載した RTX 3090 は 1 秒あたり 100 ~ 140 トークンに達すると推定されており、これはほとんどの人が読み取ることができる速度よりも速いです。
比較のために言うと、6 か月前には、700 億パラメータの高密度モデルでさえ、ローカルで使用可能な速度で実行するには、数百ギガバイトのユニファイド メモリを搭載したワークステーションか、積極的な投機的デコード トリックが必要でした。
125B モデルがゲーム カードに適合する理由
2 つのテクノロジーがこれを可能にします。 1つ目はモデル自体です。 AI Buzz Wire がリリース時に取り上げたように、Qwen3.8-Flash-Next は専門家が混合したアーキテクチャで、合計パラメータは約 1,250 億個ありますが、トークンごとにアクティブなのは約 60 億個だけです。そのため、生成された各ワードはネットワークの小さなスライスに接触し、トークンごとのコンピューティングを大幅に削減します。
2つ目は量子化です。 Strata の最速のプリセットは、モデルの重みをパラメーターごとに 2 ビットまたは 3 ビットに圧縮し、ある程度の精度を犠牲にして 12GB GPU とシステム RAM に適合するフットプリントを実現します。このトレードオフが主な注意点です。Q2 クラスおよび IQ2 クラスのクオンツでは、推論が必要なタスクの品質が明らかに低下するため、購入者はヘッドラインのスピード数値をすべてのワークロードの保証ではなく出発点として扱う必要があります。リポジトリ内のコミュニティ ベンチマーク ページは、さまざまなサイズの品質結果を追跡します。
より大きなローカル AI の波の一部
ローカル推論の勢いが加速する中、Strata が登場します。 Alibaba の Qwen ファミリーは、最もダウンロードされているオープンウェイト モデル ラインとなり、Meta と Google は独自の競合モデルをオープンソース化しており、ツールの波により、消費者はサブスクリプションやデータがデバイスから流出することなく、有能なアシスタントを実行できるようになりました。
このプロジェクトは、「消費者向けハードウェア」の定義がどのように変化しているかを反映しています。主にゲーム向けに出荷された、12 GB の VRAM を搭載したミッドレンジ 2026 グラフィックス カードは、現在、わずか 2 年前にフロンティア システムを定義したサイズ クラスのモデルの実行可能な推論アクセラレータとなっています。
Strata は初期のソフトウェアのままです。リポジトリの問題トラッカーには、古い GPU と非 AVX2 プロセッサーに関する荒削りな情報が記録されています。しかし、このプロジェクトは MIT ライセンスで無料でオープンに開発されており、Intel Arc、古い Tesla および Radeon カード、およびコミュニティ メンバーによって文書化されたマルチ GPU リグの実験的なサポートが行われています。
開発者にとって、最も実際的なポイントは、localhost API の互換性です。OpenAI または Anthropic SDK に対して作成されたスクリプトやエージェントは、ベース URL を変更することでローカルの Qwen デプロイメントにリダイレクトでき、Strata はプライバシーに配慮したプロトタイピング、オフライン使用、または単に API 支出の上限を設定するための低摩擦のオプションになります。
試してみる方法
開始するには、マニュアルを使用したターミナル セッションは必要ありません。インストーラーは、ドライバー、モデルの重み、およびローカル サーバーを 1 つのパスでプロビジョニングします。リポジトリには、AI コーディング アシスタントに直接貼り付けるように設計されたセットアップ ファイルが含まれており、AI コーディング アシスタントがマシンを自律的に構成します。ウェイトがディスクから読み込まれるため、最初の起動は遅くなります。ドキュメントでは SSD を推奨しており、長時間の会話ではより多くの作業がシステム RAM に移されると警告しています。
AI の先を行くオープンソース モデル、ローカル AI ツール、推論ハードウェアに関する最新情報については、AI Buzz Wire をフォローしてください。
AIニュースをもっと読む→