Alibaba の Qwen チームは、単一の 100 万トークンのコンテキスト ウィンドウを通じてテキスト、画像、オーディオ、ビデオ入力を受け入れる次世代ネイティブ オムニモーダル モデルである Qwen3.8-Omni-Flash を発表しました。 Qwen の公式ブログで詳しく説明されているこのリリースは、オーディオとビデオを受動的入力から AI エージェントが世界を認識して行動するための主要な媒体に変えるという、チームのこれまでで最も積極的な取り組みを示しています。

メディアの理解からそれに基づいた行動へ

Qwen3.8-Omni-Flash の目標は、メディアの理解を向上させることだけではありません。 Qwen チームによると、このモデルはオムニモーダル システムを「オムニモーダル コンテンツの理解」から「タスクの計画、ツールの呼び出し、クリエイティブな作業の完了」まで前進させるように設計されているとのことです。実際には、このモデルは、ビデオ編集、ミュージック ビデオの作成、映画の制作と解説、オーディオビジュアルの要約、リアルタイムの音声会話などのワークフローを対象としていることを意味します。

このエージェント フレーミングにより、オーディオとビデオを文字起こしまたは説明する入力として扱っていた以前のマルチモーダル モデルからリリースが分離されます。 Qwen 氏は、オーディオとビデオが「エージェントが環境を理解し、論理的に判断し、タスクを実行するためのコア メディア」に進化していると主張しています。同社は一連のエージェント ベンチマーク結果でこの主張を裏付けています。

リリースの裏にある数字

Qwen によると、オーディオ推論、オーディオビジュアル推論、オーディオビジュアル エージェントのベンチマークにわたる 29 の評価全体で、このモデルの平均スコアは前モデルの Qwen3.5-Omni-Plus より 25% 以上向上したとのことです。 Qwen ブログで報告されたヘッドラインの結果は次のとおりです。

  • オーディオビジュアル エージェントの 2 つのベンチマークである WildClawBench-MM で 36.5 ポイント、AgenticVBench で 22.3 ポイントの増加に加え、UniClawBench で 69.6 のスコア。
  • 長時間のオーディオとビデオの理解のために、LongAudioSpan で 8.3 ポイントの改善、OmniVideoBench で 9.6 ポイントの向上。
  • マルチスピーカー会議の文字起こしにおけるエラー率の劇的な低下: モデルの AliMeeting DER と cpWER は、それぞれ 88.11 と 89.61 から 3.35 と 17.18 に低下しました。

競争力の面で、Qwen は Google の製品と直接比較しています。同社は、Gemini 3.8 Flash に近いオーディオビジュアル パフォーマンスと、それを上回る全体的なオーディオ パフォーマンスを主張しています。これらの比較を独立して検証するには時間がかかりますが、ベンチマークの特異性は、Qwen がこのモデルがオムニモーダル作業の最前線で競争力があると考えていることを示しています。

数時間分のメディアに対応する 100 万トークンのウィンドウ

統合された 100 万トークンのコンテキスト ウィンドウは、おそらくこのリリースで最も実用的な機能です。オーディオとビデオはテキストよりもはるかに速くトークンを消費するため、実稼働環境のほとんどのマルチモーダル モデルは一度に数分のメディアしか処理しません。 7 桁のコンテキスト ウィンドウにより、このモデルは、チャンク化することなく、何時間もの会議の録画、長時間のビデオ映像、または大規模な混合メディア ドキュメントを 1 つのセッションに保持できます。

Qwen 氏は、このモデルは同じサイズのテキストのみのモデルと同等のテキスト パフォーマンスを維持しており、オムニモーダル トレーニングによって純粋な言語能力が低下するという一般的なトレードオフに対処していると述べています。

オーディオ入力の 98% 値下げ

アリババが最も圧力をかけているのは価格設定だ。ブログによると、オーディオ入力の 1 時間あたりの API 価格は Qwen3.5-Omni-Plus と比較して 98% 以上下落し、オーディオビジュアル入力の 1 時間あたりの価格は 93% 以上下落しました。同社の方法論ノートによると、時間当たりの料金は、720p、1 秒あたり 1 フレームで計算されたオーディオビジュアル入力で、2 分のソース素材の入力コストの 30 倍と見積もられています。

音声エージェント、会議サマライザー、またはメディア分析パイプラインを構築する開発者にとって、多くの場合、入力コストが規模に対する制約になります。 2 桁の価格下落により、どの製品が経済的に実行可能であるかが変わります。これは、安価なテキスト推論 API の最初の波を引き起こしたのと同じ動きです。

可用性とエコシステム

Qwen3.8-Omni-Flash は現在、Qianwen AI プラットフォームで利用可能であり、Alibaba Cloud Model Studio を介した API アクセスが可能で、会話型ユースケース専用のリアルタイム エンドポイントも含まれています。また、チームは Qwen-Live-Harness 評価ハーネスや Qwen-MM-Plugins などのサポートするオープンソース ツールを GitHub で公開しており、開発者がモデル上にメディア ネイティブ エージェントを構築するための出発点を提供しています。

この発表は今週初めに静かに行われましたが、ここ数日で開発者コミュニティで大きな注目を集め、ハッカー ニュースやオープン モデル エコシステムを追跡するテクノロジー アウトレットの報道で大きな議論を呼び起こしました。

オムニモーダルなレースにとってそれが何を意味するか

このリリースは、世界中で繰り返し最もダウンロードされているオープンモデル系統の一つである Qwen ファミリー全体にわたって、積極的な価格設定と競争力のあるベンチマークを組み合わせるという Alibaba の戦略を継続しています。 Qwen3.8-Omni-Flash により、同社は次の戦場はテキスト チャットではなく、映像を編集し、会議を要約し、単一の統合機能としてリアルタイムの音声会話を行う、見て、聞いて、行動できるエージェントであることに賭けています。

Gemini 3.8 Flash が明確な比較ポイントである Google にとって、オムニモーダルのフロンティアはもはや米国の研究機関間の二頭の競争ではないというメッセージです。開発者にとって、1M トークンのマルチモーダル ウィンドウとほぼ無料の音声入力の組み合わせにより、ほんの数か月前には大規模にサービスを提供するのが現実的ではなかったクラスの視聴覚エージェント製品への障壁が低くなります。

Qwen のベンチマークの主張が独立した評価の下で妥当するかどうかによって、業界がその賭けをどれだけ真剣に扱うかが決まります。しかし、方向性は明らかです。フロンティア モデルを構築しているチームは、AI エージェントのデフォルト インターフェイスとして、単なるテキスト ボックスではなく、耳と目を認識しています。

AI の先を行く

オムニモーダルな競争は週ごとに加速しています。 AI ニュースの最新情報、新モデルのリリースの詳細な分析、業界を形成するツールの報道については、AI ニュースの続きを読む → をご覧ください。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →