Inception Labs は火曜日、商用拡散言語モデルの新バージョンである Mercury 2.5 をリリースしました。これは、同社が市場で最も有能な拡散 LLM であり、同社の知る限りではこれまでにトレーニングされた最大の拡散言語モデルであると説明しています。同社の発表によると、このモデルは、前モデルの Mercury 2 に比べてインテリジェンスが 40% 向上しており、その一方で、拡散アーキテクチャが大容量ワークロードにとって魅力的なものとなっている低遅延、低コストのサービス プロファイルを維持しています。
CEO の Stefano Ermon 氏が率いる同社は、Mercury 2.5 が GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 などのコスト最適化されたフロンティア モデルに匹敵すると主張しています。これらの比較はベンダーによって報告されており、独立したベンチマークによってまだ検証されていませんが、長い間研究の関心事であった普及モデルを、自己回帰的な既存企業に代わる製品版として位置づけています。最新の AI モデルのニュースについては、AI Buzz Wire の継続的なモデルの報道に従ってください。 【最新AIモデルニュース】(https://aibuzzwire.news)
スピード、コンテキスト、価格
見出しの数字は攻撃的です。 Inception Labs によると、Mercury 2.5 は、広く利用可能な NVIDIA GPU 上で 1 秒あたり 1,107 トークンを生成し、コンテキスト ウィンドウは 260,000 トークンであるとのことです。価格は入力トークン 100 万あたり 0.20 ドル、出力トークン 100 万あたり 0.75 ドルに設定されており、発売プロモーションにより、モデルは入力 100 万あたり 0.04 ドル、出力 100 万あたり 0.15 ドルに 80% 割引されます。
機能面では、このモデルには調整可能な推論が付属しており、開発者はリクエストごとにレイテンシと深さを交換できます。また、並列ツール呼び出しと構造化された生成のためのスキーマに合わせた JSON 出力も備えています。同社は、このリリースを実稼働テレメトリによるトレーニング ループの最初の結果として位置づけています。Mercury 2 の発売以来、数千の開発者が Mercury 2 を使用して構築し、数十の企業が Mercury 2 を導入し、使用量は 1 桁以上増加しました。
拡散モデルがテキストをより速く生成する理由
OpenAI、Google、Anthropic のメインストリーム LLM は自己回帰的です。これらは一度に 1 トークンずつテキストを生成し、各トークンはその前に生成されたすべてのものに条件付けされます。この逐次的な依存関係により、生成速度が大幅に低下します。代わりに、拡散言語モデルはノイズのブロックから開始し、すべてのトークンを並行して繰り返し改良するため、モデルがきれいに収束するようにトレーニングされると、従来の GPU ハードウェアではるかに高いスループットが可能になります。
歴史的にトレードオフは品質でした。拡散モデルは、推論と指示に従うベンチマークにおいて自己回帰モデルの後を追い続けてきました。 Inception Labs の主な賭け、そして Mercury 2.5 の根底にある主張は、このギャップが、ほとんどの顧客が実際に感じている軸、つまり量産時のレイテンシとコストに関して普及が勝つところまで縮まったということです。
初期の顧客からの製品に関するクレーム
この発表は、ベンチマーク表ではなく、顧客の導入に重点を置いています。顧客とのライブ通話用の AI 電話エージェントを構築する OpenCall は、Mercury への移行により、モデルの応答遅延の中央値が約 170 ミリ秒になったと報告しました。 OpenCallの共同創設者兼最高経営責任者(CEO)であるオリバー・シルバースタイン氏は、同社のP99応答時間が数分から1秒に短縮され、中央値が0.4秒から0.2秒未満に短縮されたと述べた。この数字は、推論を有効にした場合も含め、同社がテストした他のどのプロバイダーよりも大幅に速かったと同氏は述べた。
AI コーディング アシスタント メーカーである Augment Code は、コンテキスト コンパクション、モデル ルーティング、MCP ツール検索に Mercury を使用しています。 Inception Labs によると、圧縮ワークロードを Mercury に移行すると、そのステップのレイテンシが約 150 秒から 27 秒へと 82% 短縮され、品質を維持しながらコストが 90% 削減されました。このユースケースは、経済性が問題になる部分を示しています。コーディング エージェントは、各一次世代の前後で多数の小規模なサポート モデル呼び出しを行い、それらの呼び出し全体でレイテンシとコストが増大します。
このモデルをハードウェアで実行している NVIDIA も同様の意見を述べた。NVIDIA の Accelerated Computing Group の製品シニア マネージャーである Shruti Koparkar 氏は、Inception は NVIDIA AI インフラストラクチャ上で高度な拡散ベースの言語モデルを備えており、Mercury 2.5 の持続的な速度による品質の向上は、新しいアーキテクチャがいかに早く実稼働可能なシステムに成熟できるかを示していると述べた。
Mercury Voice と Mercury Router のプレビュー
このモデルに加えて、Inception Labs は 2 つの新製品のプレビューを発表しました。 Mercury Voice は、遅延バジェットが最も厳しく、最初のトークンまでの時間を 170 ミリ秒未満でアドバタイズする音声エージェント向けに最適化された拡散 LLM です。 Mercury Router は、拡散モデルを使用して受信プロンプトを理解し、品質、速度、コストの最適な組み合わせを提供するオープンまたはクローズのモデルにルーティングし、Inception を競合他社の 1 つだけでなく上位のレイヤーとして位置づけています。
Mercury 2.5 は、Inception 独自の API、Baseten および OpenRouter を通じて利用できます。エンタープライズ展開では、専用容量、自動スケーリング、コンプライアンス制御、構成可能なデータ保持が追加されます。同社は、APIを試す開発者に1億の無料トークンを提供している。
同社はまた、次のモデルのトレーニングをすでに開始していると述べた。これは過去最大規模で、今後数か月以内のリリースを予定している。これは、拡散速度やトークン効率を一切犠牲にすることなく、機能が飛躍的に向上すると説明している。もしその主張が真実であれば、自己回帰的な既存企業に対する圧力は、価格と待ち時間がほとんどの契約を決定する市場のコモディティ層で最初に感じられることになる。
AI の先を行く
新しいモデル アーキテクチャが生産に向けて急ピッチで投入されるにつれて、最新の AI 開発と最新の人工知能ニュースを追跡してください。
AIニュースをもっと読む→