NVIDIA выпустила Nemotron 3 Embed, открытую коллекцию моделей встраивания, предназначенную для поддержки расширенной генерации извлечения (RAG), агентного извлечения, извлечения кода и памяти агента. Релиз, подробно описанный MarkTechPost от 17 июля 2026 года, представляет собой уровень, который решает, какие проходы когда-либо увидит ИИ-агент, становится полем конкурентной битвы. Этой тенденции придерживается отдел [последних новостей ИИ] (https://aibuzzwire.news), поскольку предприятия переходят от чат-ботов к системам, которые действуют на основе полученных знаний.

Встраиваемые модели решают, какие отрывки когда-либо увидит агент, что делает их тихим, но решающим узким местом в стеке генеративного ИИ. NVIDIA создала Nemotron 3 Embed, чтобы усилить этот уровень. Коллекция включает в себя три открытых контрольных точки: Nemotron-3-Embed-8B-BF16, вариант с приоритетом точности; Nemotron-3-Embed-1B-BF16, имеющий ту же конструкцию и меньшую площадь; и Nemotron-3-Embed-1B-NVFP4, 4-битный вариант, оптимизированный для Blackwell. Все три являются кодировщиками-трансформерами, обученными двунаправленной маскировке внимания, при этом окончательное внедрение производится путем усреднения по представлениям на уровне токена. Каждый поддерживает максимальную длину последовательности 32 768 токенов.

Возглавление таблицы лидеров

Главный результат заключается в том, что Nemotron-3-Embed-8B-BF16 занимает первое место в рейтинге RTEB, тесте для встраивания данных, по состоянию на 17 июля 2026 года по 16 общедоступным задачам. Оценки измеряются как средние значения NDCG@10 при длине последовательности модели 4096. NVIDIA проверила каждую модель на 34 языках, и все три контрольные точки выпущены в соответствии с лицензионным соглашением OpenMDW версии 1.1, что делает их бесплатными для загрузки, запуска и изменения разработчиками.

Примечательно, что базы модели взяты из Мистраля. Согласно отчету MarkTechPost, КПП 8B построен на базе Ministral-3-8B-Instruct-2512, тогда как оба варианта 1B используют Ministral-3-3B-Instruct-2512. Решение NVIDIA использовать основу Mistral, а не чисто собственную архитектуру, отражает то, насколько гибкой стала разработка моделей, когда открытые базы регулярно перепрофилируются и переобучаются для специализированных задач.

Сжатие, а не меньший тренировочный прогон

Выделяются два пробела в производительности. Модель 1B набирает 10,4 балла RTEB по сравнению с базовой моделью llama-nemotron-embed-vl-1b-v2 предыдущего поколения. Отдельно, 4-битная контрольная точка NVFP4 стоит всего 0,38 балла RTEB по сравнению с ее родительским BF16, сохраняя примерно 99,5% точности поиска. Такое сжатие практически без потерь особенно важно для команд, которым необходимо выполнять встраивание в большом масштабе, где часто доминируют затраты на память и логический вывод.

Эти оценки 1B были достигнуты за счет конвейера сжатия, а не за счет меньшего обучающего прогона. Родительский код, nemotron-3-embed-3b, был удален и подвергнут дистилляции в ходе двух итерационных раундов. Во-первых, родительский элемент 3B был сокращен до 2B с помощью функции поиска нейронной архитектуры mcore_minitron NVIDIA ModelOpt, которая выполняет поиск по скрытой ширине, размеру FFN, головкам внимания и глубине, а затем выбирает лучшего кандидата из топ-10 фронта Парето. Этих кандидатов оценивала калибровочная совокупность из 50 000 выборок.

Затем модель 2B была создана на основе точно настроенного учителя внедрения 8B, сочетающего потери на косинусном расстоянии и потери среднеквадратической ошибки в многоязычном сочетании данных внутри предметной области. Та же процедура была повторена для создания контрольной точки 1.14B, продемонстрировав, что меньшие варианты наследуют большую часть возможностей более крупной модели за счет структурированного сжатия, а не независимого обучения.

Создано для эффективности Blackwell

Сжатие продолжается в формате обслуживания. Целевые веса квантования и активации только линейных слоев с использованием типа данных NVFP4, при этом исследовательская группа полагалась на nvidia-modelopt v0.45.0. Затем последовала дистилляция с учетом квантования, в первую очередь для восстановления точности при длинных входных данных. Для калибровки использовалось 512 выборок, разделенных на 256 запросов и 256 отрывков из набора данных cnn_dailymail, а для обучения QAD было использовано 20 000 выборок.

Практическая выгода — эффективность новейшего оборудования NVIDIA. Исследовательская группа сообщает, что NVFP4 на платформе Blackwell обеспечивает вдвое большую пропускную способность, чем BF16, сохраняя при этом более 99% точности извлечения BF16. Карта модели NVFP4 также документирует динамические размеры встраивания, что позволяет разработчикам разрезать 2048-мерный вектор до 1024 или 512 измерений и затем повторно нормализовать, жертвуя небольшой точностью ради снижения затрат на хранение. Такая гибкость важна для векторных баз данных, где хранение миллиардов многомерных векторов обходится дорого.

Почему встраивания имеют значение сейчас

Встраивание моделей стало узким местом в стеке генеративного ИИ. Каждый агент поиска, инструмент корпоративного поиска и помощник по написанию кода зависят от них, чтобы получить правильный контекст до того, как большая языковая модель сгенерирует ответ. Более мощная и дешевая модель внедрения может напрямую улучшить качество ответов и сократить эксплуатационные расходы, поэтому поставщики от OpenAI до Cohere и коллективы разработчиков открытого исходного кода поспешили выпустить новые семейства.

Открыв исходный код самой популярной коллекции под разрешительной лицензией и объединив ее с настроенным Blackwell квантованием, NVIDIA усиливает свою стратегию по внедрению в более широкую экосистему искусственного интеллекта инструментов, которые лучше всего работают на ее собственном кристалле. Для разработчиков, создающих конвейеры RAG или системы памяти агентов, Nemotron 3 Embed предлагает новую, бесплатно доступную опцию, которая продвигает современный уровень техники в широко отслеживаемом тесте, в то время как вариант NVFP4 дает командам надежный путь к сокращению затрат на логические выводы без ущерба для качества извлечения данных, от которого зависят их приложения.

Будьте впереди ИИ

Модели открытого внедрения, такие как Nemotron 3 Embed, незаметно меняют то, как агенты ИИ находят и используют информацию. Чтобы узнать больше о моделях, выпусках и исследованиях, продвигающих эту область, следите за нашими [последними разработками в области искусственного интеллекта] (https://aibuzzwire.news) по мере их выхода.

Читать больше новостей об искусственном интеллекте ->