人工知能がシングルターンのチャットボットから継続的に実行される自律エージェントに移行する中、NVIDIA はその瞬間に合わせてオープン モデルのラインナップを拡大しています。 2026 年 8 月 11 日、同社は、長時間実行されるエージェント AI ワークロード向けのクラス最高効率モデルと同社が呼ぶ、300 億パラメータの専門家混合モデルである Nemotron 3.5 Lightning を発表しました。このリリースは、Kari Briski による NVIDIA ブログで詳しく説明されており、NeMo Switchyard とともにリリースされます。これは、各タスクを最も機能的でコスト効率の高いモデルに自動的に誘導するように設計されたオープンソース ルーティング ライブラリです。最新の AI 業界の報道 については、エージェント AI スタックが具体化される様子をフォローしてください。

常時稼働エージェント用に構築されたモデル

最新のエージェント システムは、NVIDIA が「モデルのシステム」またはモデル アンサンブルと表現するものとして動作することが増えています。 Nemotron 3 Ultra や GPT-5.6 などのフロンティア推論モデルはワークフローを計画および調整することができますが、より小規模な特殊モデルはコード レビュー、ツールの使用、セキュリティ アラートの監視、請求に関する質問への回答などの対象タスクを処理します。 Nemotron 3.5 Lightning は、第 2 層、つまり常時稼働のエージェントに電力を供給する大量の特殊なタスクに特化して構築されています。

NVIDIA によると、このモデルは最大 4 倍高速な出力速度を実現し、同クラスの他のモデルと比較して約 30% 高速なエージェント タスク完了につながります。 NVIDIA 独自の PinchBench ベンチマークは、Nemotron 3.5 Lightning がフロンティアレベルの精度を維持しながら、他の製品よりも迅速にタスクを完了することを実証していると報告されています。このモデルは、Nemotron Coalition からの貢献によって開発されました。Nemotron Coalition のメンバーは、モデルの進歩に役立つ評価方法論、推論ソフトウェア、およびデータセットを提供しました。

オープンでカスタマイズ可能なため、組織は独自のドメイン データ、ツール、ワークフローで NVIDIA NeMo を使用して Nemotron 3.5 Lightning を事後トレーニングして、特殊なタスクの精度を向上させることができます。 NVIDIA は、エージェント機能をコーディングするためのモデルの事後トレーニングに使用されるエージェント強化学習データセットである Nemotron-RL-Agentic-terminal-Pivot もリリースしています。

エッジからクラウドまで、どこでも実行可能

Nemotron 3.5 Lightning の中心的なセールスポイントの 1 つは、導入の柔軟性です。このモデルは、NVIDIA RTX PC、NVIDIA DGX Spark、NVIDIA DGX Station、NVIDIA Jetson などのローカル AI システム上で実行でき、組織は既存のインフラストラクチャへの投資を最大限に活用できます。また、エンタープライズ ユースケース向けに、エッジ AI デバイス、NVIDIA RTX PRO ワークステーション、データ センター、クラウド環境全体に拡張することもできます。この柔軟性は、オンプレミスに残しておく必要がある機密データを扱う組織にとって重要です。

すべての Nemotron リリースと同様に、NVIDIA はライセンスが許可する限りのトレーニング データとテクニックを公開し、これにより他のモデルのトレーサビリティ、監査、トレーニングが可能になると述べています。企業がオープンモデルと、その構築方法の可視性が低い独自の代替モデルを比較検討する中で、この透明性への取り組みが競争上の差別化要因となっています。

NeMo Switchyard: モデルのシステム向けのスマート ルーティング

Nemotron 3.5 Lightning が主力製品である場合、NeMo Switchyard がディスパッチャーです。オープンソース ライブラリは、特定のニーズに基づいて、エージェント ワークフローの各ステップで最も機能的で効率的なモデルにプロンプ​​トを自動的にルーティングします。一部のモデルはコーディングに適しており、一部は推論に適しており、一部は軽量タスクに適しており、プライバシーと効率を高めるためにローカルで実行するように最適化されているモデルもあります。単一のデフォルト モデルに依存すると、過剰な支出や品質の犠牲を意味する可能性があります。一方、ルーティングを手動で管理することは統合作業となり、展開が遅くなる可能性があります。

エージェント アプリケーション開発者は、品質、遅延、コスト要件などの優先順位に合わせて、さまざまなルーティング アルゴリズムを使用してルーターを調整または変更できます。 NVIDIA の内部ベンチマークによると、NeMo Switchyard はフロンティア レベルの精度を維持しながら、タスク完了コストを Opus 4.8 単独の 3 分の 1 近く に削減しており、これは多数のエージェント タスクを実行している組織にとって驚くべき効率の向上です。

同社は一連のパートナー統合を強調した。 Boomi は、ドメイン ルーティングの精度が 100% であり、トラフィックの 59% が 5 倍高速の微調整モデルに送信されたと報告しました。 Cadence は、正式な検証のユースケースで効率を 9.9% 向上させました。 Cognition は Switchyard を Devin Desktop に統合し、平均コストを 28% 削減しながら、FrontierCode Main でほぼ最前線のパフォーマンスを達成しました。 LangChain は、コールの 7% のみをフロンティア モデルにルーティングすることで、145 のマルチターン Deep Agent タスク全体でコストが 74% 削減されたと報告しました。 LiteLLM は NeMo Switchyard をプロキシ層にプラグインとして追加しており、Kong は Kong AI ゲートウェイを通じてネイティブにルーティングを提供するようになりました。特に、Nous Research は NeMo Switchyard を Hermes に統合し、開発者にエージェントの効率性を高めるための簡単に設定できるルーティング システムを提供しました。

業界での導入と全体像

業界全体の AI リーダーはすでに Nemotron 3.5 Lightning をワークロードに合わせてカスタマイズしています。 CrowdStrike はこれをサイバーセキュリティに適用し、Harvey は法律サービスに使用し、CodeRabbit はコードレビューにそれを導入しています。 Lila Sciences は、物理科学および生命科学にわたるエージェント タスクの推論機能の向上を支援しており、Fastino Labs はモデルをカスタマイズし、ソフトウェア開発、財務、ヘルスケアのワークロードにおいて優れた精度を報告しています。

このリリースは、エージェント AI が成熟するにつれ、許容可能なコストですべてをうまく実行できる単一のモデルは存在しないという、より広範な業界の傾向を強調しています。未来はアンサンブル、つまり専門の労働者の艦隊を調整するフロンティア プランナーと、それらを結び付けるツールに属します。 NVIDIA は、オープン モデルとインテリジェント ルーティングにより、企業が単一のプロバイダーのスタックに縛られることなくこれらのシステムを構築できるようになると考えています。

AI の先を行く

NVIDIA の Nemotron 3.5 Lightning と NeMo Switchyard は、より高速、より安価、より透明性があり、どこにでも展開できるというエージェント AI の方向性を示しています。モデルのリリースや状況を再構築するエンタープライズ ツールの最新情​​報を入手するには、AI ニュース速報 をご覧ください。

AIニュースをもっと読む→