アリババの Qwen チームは水曜日、Qwen3.8-Flash-Next をリリースしました。これは、次期 Qwen4 のアーキテクチャ プレビューを兼ねたマルチモーダルな専門家混合モデルです。これにより、トレーニング コストの約 9 分の 1 で、はるかに大規模な Qwen3.7-Plus を上回る結果が得られると同社は述べています。ロイター、ブルームバーグ、ザ・デコーダーはいずれもこの発表を報じており、Z.aiが自社のフロンティア隣接オープンモデルを出荷したのと同じ日に、ハギングフェイスとモデルスコープにオープンウェイトを載せている。無差別級レースが加速する中、最新 AI ニュース をフォローしてください。
ミニチュアの新しい建築
見出しの仕様は効率です。 Qwen3.8-Flash-Next には合計 1,250 億のパラメーターがありますが、トークンごとにアクティブになるのは 60 億のみです。比較のために言うと、Qwen3.7-Plus (アリババの公開ベンチマークで優れたパフォーマンスを誇るモデル) には合計 3,970 億のパラメータがあり、トークンごとに 170 億がアクティブ化されており、これは Flash-Next のアクティブ数のほぼ 3 倍です。
技術的に最も興味深い部分は、510 億個のパラメータを運ぶ新しい N グラム埋め込み層です。この層は、The Decoder の Matthias Bastian 氏が一種の「フレーズ辞書」と表現したもののスタンドアロン エントリとして一般的な単語グループを保存し、ネットワークの先頭にフレーズ レベルの情報を送り込みます。重要なのは、Qwen チームが比較的低い追加コストで、高価な GPU メモリではなく通常のシステム RAM に配置されていることです。これは、Qwen4 に導入される予定のアーキテクチャ上の革新です。
このモデルは、262,144 トークンのコンテキスト ウィンドウをネイティブにサポートし、YaRN ロング コンテキスト拡張機能を使用して 100 万トークンまで拡張します。技術レポートはGitHubで公開されています。
ベンチマーク: コーディングと事務作業
Alibaba のベンチマークでは、Flash-Next を DeepSeek-V4-Flash (パラメータ 2,840 億、アクティブ 130 億) および Anthropic の Claude Opus 4.6 (Max) と比較します。どちらのライバルもはるかに規模が大きく、高価であるにもかかわらず、Flash-Next はテストされたタスクの大部分でリードしており、コーディングとオフィスの生産性において最大の向上をもたらしています。
エージェント コーディングでは、Flash-Next は DeepSWE 1.1 で 58.7、SWE-bench Pro で 62.5 のスコアを獲得し、DeepSeek-V4-Flash と Claude Opus 4.6 の両方を上回りました。オフィス タスクの差はさらに大きく、DeepSeek-V4-Flash の 45.1 に対して CoWorkBench では 73.9、JobBench では 55.7 で、Qwen3.7-Plus の 27.6 のほぼ 2 倍です。科学的推論は分野全体でほぼ一致しており、Flash-Next は GPQA Diamond で 91.7、LiveCodeBench v6 では 91.9 でした。クロード オーパス 4.6 は、人類最後の試験 (40.0 ~ 35.9) でのみ先行して公開されており、2026 年 2 月の古い人類モデルです。いつものように、公開されているベンチマーク スコアと実際のパフォーマンスは異なる場合があります。
すべてのライバルに対する価格圧力
製品版は QwenCloud を通じて Qwen3.8-Flash として出荷され、価格は入力トークン 100 万あたり 0.16 ドル、出力トークン 100 万あたり 0.47 ドルです。これは、同日にそれぞれ 0.15 ドルと 0.50 ドルでリリースされた Z.ai の GLM-5.3-Flash をも下回り、事実上市場最下位と同等です。
アリババ自身の旗艦との差は歴然だ。 Claude Opus 4.8、Gemini 3.1 Pro、GPT-5.6 Sol と競合するために 8 月上旬に導入された Qwen3.8-Max の価格は、入力トークン 100 万あたり 2.00 ドル、出力トークン 100 万あたり 6.00 ドルです。アリババ自身の数字によれば、Flash-Next のパフォーマンスは主力製品のすぐ下で、価格はインプットとアウトプットの両方でおよそ 12 分の 1 です。
長いコンテキストにより、仕様書を超えた実用的な価値が追加されます。ネイティブ トークンが 262,144 個ある場合、1 つのリクエストで複数の大規模なコード リポジトリ、完全な契約セット、または何時間もの文字起こしされた会議を保持できます。 YaRN を使用して 100 万トークンまで拡張すると、検索足場なしでコーパス全体の分析が可能になります。 Flash-Next が最も高いスコアを投稿するエージェント コーディング ワークロード (実際のソフトウェア プロジェクトのバグを独自に見つけて修正する) では、ウィンドウが大きいため、タスク中のコンテキスト管理の失敗が少なくなります。 Qwen チームは GitHub で技術レポートも公開しており、まさにプロプライエタリなラボが避けているような独立したアーキテクチャの精査を求めています。
このリリースが重要な理由
Qwen3.8-Flash-Next は、Qwen4 の公開リハーサルとして最もよく理解されています。 N-gram 埋め込みレイヤー、積極的なアクティブ パラメーター比、嵩張るがめったに必要とされないパラメーターの RAM オフロードは、GPU あたりのインテリジェンスではなく、1 ドルあたりのインテリジェンスを移動するという設計哲学を表しています。 Qwen3.7-Plus を上回るモデルを 9 分の 1 のコストでトレーニングすることは、まさに高速のイテレーション サイクルを手頃な価格にする機能です。そして、どのベンチマークよりもイテレーション速度が、1 年後に誰がフロンティアに立つかを決定します。
FourWeekMBA が観察したように、中国の研究所からフロンティアに隣接する 2 つのオープンウェイト モデル、Z.ai の GLM-5.3-Flash と Alibaba の Flash-Next が同日到着したことも、リズムの変化を示しています。欧米の研究所は依然としてベンチマークのピークを維持しているが、無差別級は現在、ほぼフロンティアの品質で、価格は一桁安い状態で毎週出荷されている。
開発者にとって実際に得られることは単純です。ダウンロード可能なウェイトが単一プロバイダーに対する保険となり、有能でロングコンテキストのマルチモーダル モデルのコストが再び下がりました。競合他社にとって、このメッセージはあまり快適ではありません。効率のフロンティアは現在、主力価格が現実的に追従できる速度を超えて進んでおり、アリババは減速する兆候を示していません。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→