NVIDIA 发布了 Nemotron 3 Embed,这是一个开放的嵌入模型集合,旨在为生产规模的检索增强生成 (RAG)、代理检索、代码检索和代理内存提供支持。 MarkTechPost 于 2026 年 7 月 17 日详细介绍了该版本的发布,当时决定 AI 代理看到哪些段落的层已成为竞争战场,随着企业从聊天机器人转向根据检索到的知识采取行动的系统,本出版物的 突发 AI 新闻 部门也遵循这一趋势。

嵌入模型决定代理会看到哪些段落,这使它们成为生成人工智能堆栈中安静但决定性的瓶颈。 NVIDIA 构建了 Nemotron 3 Embed 来强化该层。该集合包括三个开放检查点:Nemotron-3-Embed-8B-BF16,准确性第一选项; Nemotron-3-Embed-1B-BF16,将相同的设计融入更小的占地面积; Nemotron-3-Embed-1B-NVFP4,Blackwell 优化的 4 位变体。这三个都是经过双向注意力掩蔽训练的变压器编码器,最终嵌入是通过令牌级表示的平均池化产生的。每个支持最大序列长度为 32,768 个令牌。

登上排行榜榜首

总体结果是,截至 2026 年 7 月 17 日,Nemotron-3-Embed-8B-BF16 在 RTEB(检索嵌入基准)上的 16 项公共任务中总体排名第一。分数以模型序列长度为 4,096 时的平均 NDCG@10 来衡量。 NVIDIA 跨 34 种语言评估了每个模型,所有三个检查点均根据 OpenMDW 许可协议版本 1.1 发布,可供开发人员免费下载、运行和修改。

值得注意的是,模型基础取自米斯特拉尔。据 MarkTechPost 报告称,8B 检查点基于 Ministral-3-8B-Instruct-2512 构建,而两个 1B 变体均使用 Ministral-3-3B-Instruct-2512。 NVIDIA 决定在 Mistral 的基础上构建而不是纯粹的内部架构,这反映了模型开发的流畅性,开放基础经常针对专门任务进行重新调整和重新训练。

压缩,而不是较小的训练跑

有两个突出的性能差距。 1B 模型比上一代 llama-nemotron-embed-vl-1b-v2 基线提高了 10.4 RTEB 点。另外,NVFP4 4 位检查点与其 BF16 父级相比仅花费 0.38 RTEB 点,保留了大约 99.5% 的检索精度。这种近乎无损的压缩对于需要大规模运行嵌入的团队来说尤其重要,因为内存和推理成本通常占主导地位。

这些 1B 分数是通过压缩管道而不是较小的训练运行获得的。父代 nemotron-3-embed-3b 在两轮迭代中被修剪和提炼。首先,使用 NVIDIA ModelOpt 的 mcore_minitron 神经架构搜索将 3B 父级修剪为 2B,该搜索搜索隐藏宽度、FFN 大小、注意力头和深度,然后从前 10 个 Pareto 前沿中挑选最佳候选者。一个包含 50,000 个样本的域内校准语料库对这些候选者进行了评分。

接下来,2B 模型是从经过微调的 8B 嵌入教师中提炼出来的,结合了多语言、域内数据混合的余弦距离损失和均方误差损失。重复相同的过程来生成 1.14B 检查点,表明较小的变体通过结构化压缩而不是独立训练继承了较大模型的大部分功能。

专为 Blackwell 效率而打造

压缩继续进入服务格式。量化仅针对线性层的权重和激活,使用 NVFP4 数据类型,研究团队依赖 nvidia-modelopt v0.45.0。接下来是量化感知蒸馏,主要是为了恢复长输入的准确性。校准使用了 512 个样本,分为来自 cnn_dailymail 数据集的 256 个查询和 256 个段落,而 QAD 训练则使用了 20,000 个样本。

实际回报是 NVIDIA 最新硬件的效率。研究团队报告称,Blackwell 上的 NVFP4 的吞吐量比 BF16 高出 2 倍,同时保留 BF16 99% 以上的检索精度。 NVFP4 模型卡还记录了动态嵌入大小,允许开发人员将 2,048 维向量切片为 1,024 或 512 维,然后重新标准化,以一点精度换取较低的存储成本。这种灵活性对于矢量数据库来说很重要,因为在矢量数据库中存储数十亿个高维矢量的成本很高。

为什么嵌入现在很重要

嵌入模型已经成为生成人工智能堆栈中的一个安静的瓶颈。每个基于检索的代理、企业搜索工具和代码助手都依赖它们在大型语言模型生成响应之前获取正确的上下文。更强大、更便宜的嵌入模型可以直接提高答案质量并降低运营成本,这就是为什么从 OpenAI 到 Cohere 再到开源集体的供应商都争先恐后地发布新系列的原因。

通过在宽松的许可下开源排名靠前的集合,并将其与 Blackwell 调整的量化相结合,NVIDIA 正在强化其战略,即利用在自有芯片上运行最佳的工具为更广泛的 AI 生态系统提供种子。对于构建 RAG 管道或代理内存系统的开发人员来说,Nemotron 3 Embed 提供了一个全新的、免费的选项,将最先进的技术推向了广泛关注的基准,而 NVFP4 变体则为团队提供了一条可靠的途径,可以在不牺牲应用程序所依赖的检索质量的情况下降低推理成本。

保持人工智能领先地位

Nemotron 3 Embed 等开放嵌入模型正在悄然重塑人工智能代理查找和使用信息的方式。有关推动该领域向前发展的模型、版本和研究的更多信息,请关注我们的最新人工智能发展

阅读更多人工智能新闻 ->