NVIDIA は、実稼働規模の検索拡張生成 (RAG)、エージェント検索、コード検索、およびエージェント メモリを強化するように設計された埋め込みモデルのオープン コレクションである Nemotron 3 Embed をリリースしました。 2026 年 7 月 17 日に MarkTechPost によって詳述されたこのリリースは、AI エージェントがどのパッセージを目にするかを決定するレイヤーが競争の戦場になる中で到着しました。これは、企業がチャットボットから取得した知識に基づいて動作するシステムに移行するにつれて、この出版物の 最新 AI ニュース デスクが追随してきた傾向です。

Embedding models decide which passages an agent ever sees, which makes them a quiet but decisive chokepoint in the generative AI stack. NVIDIA は、その層を強化するために Nemotron 3 Embed を構築しました。このコレクションには、3 つのオープン チェックポイントが含まれています。Nemotron-3-Embed-8B-BF16、精度最優先のオプションです。 Nemotron-3-Embed-1B-BF16 は、同じ設計をより小さな設置面積に実現します。 Nemotron-3-Embed-1B-NVFP4、Blackwell に最適化された 4 ビット バリアント。 3 つすべては双方向アテンション マスキングでトレーニングされたトランスフォーマー エンコーダーであり、最終的な埋め込みはトークン レベルの表現に対する平均プーリングによって生成されます。それぞれが 32,768 トークンの最大シーケンス長をサポートします。

Topping the Leaderboard

主要な結果は、2026 年 7 月 17 日の時点で、Nemotron-3-Embed-8B-BF16 が RTEB (検索埋め込みベンチマーク) で 16 の公開タスク全体で総合 1 位にランクされているということです。スコアは、モデル配列長 4,096 での平均 NDCG@10 として測定されます。 NVIDIA は 34 の言語で各モデルを評価し、3 つのチェックポイントはすべて OpenMDW ライセンス契約バージョン 1.1 に基づいてリリースされ、開発者がダウンロード、実行、変更できるように自由に利用できるようになりました。

Notably, the model bases are drawn from Mistral. MarkTechPostのレポートによると、8BチェックポイントはMinistral-3-8B-Instruct-2512に基づいて構築されていますが、1Bバリアントは両方ともMinistral-3-3B-Instruct-2512を使用しています。純粋な社内アーキテクチャではなく、Mistral の基盤上に構築するという NVIDIA の決定は、オープン ベースが定期的に再利用され、特殊なタスク用に再トレーニングされるなど、モデル開発が流動的になっている状況を反映しています。

Compression, Not a Smaller Training Run

Two performance gaps stand out. 1B モデルは、前世代の llama-nemotron-embed-vl-1b-v2 ベースラインより 10.4 RTEB ポイントを獲得しています。これとは別に、NVFP4 4 ビット チェックポイントのコストは、親 BF16 に対してわずか 0.38 RTEB ポイントであり、検索精度の約 99.5% を維持します。このほぼ可逆圧縮は、メモリと推論のコストが支配的なことが多い、大規模なエンベディングを実行する必要があるチームにとって特に重要です。

Those 1B scores were achieved through a compression pipeline rather than a smaller training run. The parent, nemotron-3-embed-3b, was pruned and distilled across two iterative rounds.まず、NVIDIA ModelOpt の mcore_minitron ニューラル アーキテクチャ検索を使用して、3B の親が 2B にプルーニングされました。この検索で​​は、隠れ幅、FFN サイズ、アテンション ヘッド、深度を検索し、トップ 10 のパレート フロントから最適な候補を選択します。 50,000 サンプルのドメイン内キャリブレーション コーパスがこれらの候補をスコア付けしました。

次に、多言語のドメイン内データ ブレンドにおけるコサイン距離損失と平均二乗誤差損失を組み合わせて、微調整された 8B 埋め込み教師から 2B モデルが抽出されました。同じ手順を繰り返して 1.14B チェックポイントを作成しました。これは、小規模なバリアントが、独立したトレーニングではなく構造化された圧縮を通じて、より大きなモデルの機能の多くを継承していることを示しています。

Built for Blackwell Efficiency

Compression continues into the serving format.研究チームは nvidia-modelopt v0.45.0 を使用し、量子化は NVFP4 データ型を使用して線形層のみの重みとアクティベーションを対象としました。主に長い入力の精度を回復するために、量子化対応蒸留が続きました。キャリブレーションでは、cnn_dailymail データセットからの 256 クエリと 256 パッセージに分割された 512 サンプルが使用されましたが、QAD トレーニングでは 20,000 サンプルが使用されました。

The practical payoff is efficiency on NVIDIA's latest hardware.研究チームは、Blackwell 上の NVFP4 は、BF16 の 99% 以上の取得精度を維持しながら、BF16 よりも最大 2 倍高いスループットを実現すると報告しています。 NVFP4 モデル カードには動的な埋め込みサイズも記載されているため、開発者は 2,048 次元のベクトルを 1,024 または 512 次元にスライスし、後で再正規化して、ストレージ コストを下げるために多少の精度を犠牲にすることができます。 That flexibility matters for vector databases, where storing billions of high-dimensional vectors is expensive.

なぜ今埋め込みが重要なのか

Embedding models have become a quiet chokepoint in the generative AI stack.すべての検索ベースのエージェント、エンタープライズ検索ツール、およびコード アシスタントは、大規模な言語モデルが応答を生成する前に適切なコンテキストを取得するためにそれらに依存しています。より強力で安価な埋め込みモデルは、回答の品質を直接向上させ、運用コストを削減することができます。そのため、OpenAI から Cohere、オープンソース集合体までのベンダーが新しいファミリーのリリースを急いでいます。

NVIDIA は、寛容なライセンスの下でトップランクのコレクションをオープンソース化し、Blackwell で調整された量子化と組み合わせることで、自社のシリコンで最適に動作するツールを広範な AI エコシステムに播種する戦略を強化しています。 RAG パイプラインやエージェント メモリ システムを構築する開発者にとって、Nemotron 3 Embed は、幅広く注目されているベンチマークで最先端の技術を推し進める、新しく無料で利用できるオプションを提供します。一方、NVFP4 バリアントは、アプリケーションが依存する取得品質を犠牲にすることなく、推論コストを削減するための信頼できる道をチームに提供します。

AI の先を行く

Open embedding models like Nemotron 3 Embed are quietly reshaping how AI agents find and use information.この分野を前進させるモデル、リリース、研究の詳細については、最新の AI 開発 を随時フォローしてください。

AI ニュースをもっと読む ->