NVIDIA випустила Nemotron 3 Embed, відкриту колекцію моделей вбудовування, розроблених для забезпечення генерації з розширеним пошуком (RAG), агентського пошуку, пошуку коду та пам’яті агента. Реліз, детально описаний MarkTechPost 17 липня 2026 року, надходить, коли рівень, який вирішує, які проходи бачитиме агент штучного інтелекту, стає конкурентним полем битви. Ця тенденція дотримується відділу цієї публікації найважливі новини штучного інтелекту, оскільки підприємства переходять від чат-ботів до систем, які працюють на основі отриманих знань.
Моделі вбудовування вирішують, які проходи бачитиме агент, що робить їх тихою, але вирішальною гальмівною точкою в генеруючому стеку ШІ. NVIDIA створила Nemotron 3 Embed, щоб посилити цей рівень. Колекція включає три відкриті контрольні точки: Nemotron-3-Embed-8B-BF16, варіант точності першої; Nemotron-3-Embed-1B-BF16, який має таку саму конструкцію в меншій площі; і Nemotron-3-Embed-1B-NVFP4, оптимізований Blackwell 4-розрядний варіант. Усі три є кодерами-трансформерами, навченими двонаправленому маскуванню уваги, з остаточним вбудовуванням, створеним шляхом об’єднання середніх значень уявлень на рівні маркерів. Кожен підтримує максимальну довжину послідовності 32 768 токенів.
Очолення таблиці лідерів
Заголовний результат полягає в тому, що Nemotron-3-Embed-8B-BF16 посідає перше місце в рейтингу RTEB, Retrieval Embedding Benchmark, станом на 17 липня 2026 року, серед 16 публічних завдань. Оцінки вимірюються як середнє значення NDCG@10 при довжині модельної послідовності 4096. NVIDIA оцінила кожну модель 34 мовами, і всі три контрольні точки випущені відповідно до ліцензійної угоди OpenMDW версії 1.1, що робить їх вільно доступними для завантаження, запуску та модифікації розробниками.
Примітно, що базові моделі взяті з Mistral. Згідно з повідомленням MarkTechPost, блокпост 8Б побудований на Ministral-3-8B-Instruct-2512, тоді як обидва варіанти 1B використовують Ministral-3-3B-Instruct-2512. Рішення NVIDIA побудувати базу Mistral, а не суто внутрішню архітектуру, відображає те, наскільки плавною стала розробка моделей, коли відкриті бази регулярно перепрофільовуються та перенавчаються для спеціальних завдань.
Стиснення, а не менший тренувальний пробіг
Виділяються дві прогалини в продуктивності. Модель 1B отримує 10,4 бала RTEB порівняно з базовим рівнем llama-nemotron-embed-vl-1b-v2 попереднього покоління. Окремо 4-розрядна контрольна точка NVFP4 коштує лише 0,38 балів RTEB проти батьківської версії BF16, зберігаючи приблизно 99,5% своєї точності пошуку. Таке стиснення майже без втрат особливо важливо для команд, яким потрібно запускати вбудовування в масштабі, де часто домінують витрати на пам’ять і логічні висновки.
Ці оцінки 1B були досягнуті завдяки конвеєру стиснення, а не меншому тренуванню. Батьківський, nemotron-3-embed-3b, був скорочений і дистильований протягом двох ітераційних раундів. Спочатку батьківський 3B був скорочений до 2B за допомогою NVIDIA ModelOpt mcore_minitron Neural Architecture Search, який шукає за прихованою шириною, розміром FFN, головками уваги та глибиною, а потім вибирає найкращого кандидата з топ-10 Парето. 50 000 зразків внутрішнього калібрувального корпусу оцінили цих кандидатів.
Далі модель 2B була виділена з точно налаштованого викладача вбудовування 8B, поєднуючи косинусну втрату відстані та середню квадратичну втрату помилки в багатомовній суміші даних у домені. Ту саму процедуру було повторено для створення контрольної точки 1.14B, демонструючи, що менші варіанти успадковують більшу частину можливостей більшої моделі через структуроване стиснення, а не через незалежне навчання.
Створено для ефективності Blackwell
Стиснення продовжується у форматі обслуговування. Квантування націлене на ваги та активації лише лінійних шарів, використовуючи тип даних NVFP4, а дослідницька група покладалася на nvidia-modelopt v0.45.0. Після цього була використана дистиляція з урахуванням квантування, головним чином для відновлення точності на довгих вхідних даних. Для калібрування використано 512 зразків, розділених на 256 запитів і 256 уривків із набору даних cnn_dailymail, тоді як для навчання QAD було використано 20 000 зразків.
Практичною винагородою є ефективність на новітньому апаратному забезпеченні NVIDIA. Дослідницька група повідомляє, що NVFP4 на Blackwell забезпечує до 2 разів більшу пропускну здатність, ніж BF16, зберігаючи понад 99% точності пошуку BF16. Картка моделі NVFP4 також документує розміри динамічного вбудовування, дозволяючи розробникам розрізати 2048-вимірний вектор до 1024 або 512 розмірів і знову нормалізувати потім, обмінюючи невелику точність на меншу вартість зберігання. Ця гнучкість має значення для векторних баз даних, де зберігання мільярдів високовимірних векторів коштує дорого.
Чому вбудовування важливі зараз
Вбудовані моделі стали тихою перешкодою в генеративному стеку AI. Кожен агент на основі пошуку, інструмент корпоративного пошуку та помічник коду залежать від них, щоб отримати правильний контекст, перш ніж велика мовна модель згенерує відповідь. Сильніша та дешевша модель вбудовування може безпосередньо покращити якість відповідей і скоротити експлуатаційні витрати, тому постачальники від OpenAI до Cohere і колективів із відкритим кодом поспішили випустити нові сімейства.
Відкривши колекцію найвищого рейтингу за дозвільною ліцензією та поєднавши її з квантуванням, налаштованим Blackwell, NVIDIA посилює свою стратегію заповнення ширшої екосистеми ШІ інструментами, які найкраще працюють на власному кремнієвому процесорі. Для розробників, які створюють конвеєри RAG або системи пам’яті агентів, Nemotron 3 Embed пропонує свіжу, безкоштовно доступну опцію, яка просуває сучасні технології на широко відомий тест, тоді як варіант NVFP4 дає командам надійний шлях до скорочення витрат на логічні висновки без шкоди для якості пошуку, від якої залежать їхні програми.
Будьте попереду ШІ
Відкриті моделі вбудовування, такі як Nemotron 3 Embed, тихо змінюють те, як агенти ШІ знаходять і використовують інформацію. Щоб дізнатися більше про моделі, випуски та дослідження, які просувають сферу розвитку, слідкуйте за нашими [останніми розробками штучного інтелекту] (https://aibuzzwire.news) у міру їх появи.
Читати більше новин AI ->



