Společnost NVIDIA vydala Nemotron 3 Embed, otevřenou sbírku modelů vkládání navržených tak, aby podporovaly generování rozšířeného získávání dat ve výrobním měřítku (RAG), získávání agentů, získávání kódu a paměť agentů. Vydání, které 17. července 2026 podrobně popsal MarkTechPost, přichází jako vrstva, která rozhoduje o tom, které pasáže agent AI kdy uvidí, se stane konkurenčním bojištěm, což je trend aktuální zprávy o AI této publikace, když podniky přecházejí od chatbotů k systémům, které jednají na základě získaných znalostí.
Vkládací modely rozhodují o tom, které pasáže agent kdy uvidí, což z nich dělá tichý, ale rozhodující škrticí bod v generativním zásobníku AI. NVIDIA vytvořila Nemotron 3 Embed, aby tuto vrstvu posílila. Kolekce obsahuje tři otevřené kontrolní body: Nemotron-3-Embed-8B-BF16, volba na prvním místě; Nemotron-3-Embed-1B-BF16, který nese stejný design na menší půdorysu; a Nemotron-3-Embed-1B-NVFP4, 4bitová varianta optimalizovaná pro Blackwell. Všechny tři jsou transformátorové kodéry vyškolené s obousměrným maskováním pozornosti, přičemž konečné vložení je vytvořeno průměrným sdružováním reprezentací na úrovni tokenů. Každý podporuje maximální délku sekvence 32 768 tokenů.
Vedení žebříčku
Hlavním výsledkem je, že Nemotron-3-Embed-8B-BF16 se k 17. červenci 2026 umístil na prvním místě v RTEB, benchmarku Retrieval Embedding Benchmark, v rámci svých 16 veřejných úkolů. Skóre se měří jako průměr NDCG@10 při modelové délce sekvence 4096. NVIDIA vyhodnotila každý model ve 34 jazycích a všechny tři kontrolní body jsou vydány v rámci licenční smlouvy OpenMDW verze 1.1, díky čemuž jsou vývojářům volně dostupné ke stažení, spuštění a úpravám.
Je pozoruhodné, že modelové základy jsou čerpány z Mistralu. Kontrolní bod 8B je postaven na Ministral-3-8B-Instruct-2512, zatímco obě varianty 1B používají Ministral-3-3B-Instruct-2512, podle zprávy MarkTechPost. Rozhodnutí společnosti NVIDIA stavět na základech Mistral spíše než na čistě interní architektuře odráží to, jak se vývoj modelu stal plynulým, s otevřenými základnami, které se běžně přeměňují a přeškolují na specializované úkoly.
Komprese, ne menší tréninkový běh
Vynikají dvě výkonnostní mezery. Model 1B získává 10,4 bodů RTEB oproti základní linii předchozí generace lama-nemotron-embed-vl-1b-v2. Samostatně stojí 4bitový kontrolní bod NVFP4 pouze 0,38 bodu RTEB oproti jeho nadřazenému BF16, přičemž si zachovává zhruba 99,5 % přesnosti vyhledávání. Tato téměř bezztrátová komprese je zvláště významná pro týmy, které potřebují spouštět vkládání ve velkém, kde často dominují náklady na paměť a odvození.
Těchto 1B skóre bylo dosaženo spíše kompresním potrubím než menším tréninkem. Rodič, nemotron-3-embed-3b, byl oříznut a destilován ve dvou iteračních kolech. Nejprve byl 3B rodič oříznut na 2B pomocí mcore_minitron Neural Architecture Search společnosti NVIDIA ModelOpt, který prohledává skrytou šířku, velikost FFN, pozornost hlavy a hloubku a poté vybere nejlepšího kandidáta z první desítky Pareto. 50 000 vzorků in-domain kalibrační korpus ohodnotil tyto kandidáty.
Dále byl model 2B destilován z jemně vyladěného učitele vkládání 8B, který kombinuje ztrátu kosinové vzdálenosti a střední ztrátu druhé mocniny přes vícejazyčnou směs dat v doméně. Stejný postup byl zopakován pro vytvoření kontrolního bodu 1,14B, což prokázalo, že menší varianty zdědí většinu schopností většího modelu prostřednictvím strukturované komprese spíše než nezávislého tréninku.
Vytvořeno pro Blackwell Efficiency
Komprese pokračuje do formátu zobrazování. Kvantizace se zaměřila pouze na váhy a aktivace lineárních vrstev pomocí datového typu NVFP4, přičemž výzkumný tým se spoléhal na nvidia-modelopt v0.45.0. Následovala destilace založená na kvantizaci, primárně k obnovení přesnosti na dlouhých vstupech. Kalibrace použila 512 vzorků, rozdělených mezi 256 dotazů a 256 pasáží z datové sady cnn_dailymail, zatímco školení QAD čerpalo z 20 000 vzorků.
Praktickou odměnou je účinnost na nejnovějším hardwaru NVIDIA. Výzkumný tým uvádí, že NVFP4 na Blackwell poskytuje až 2x vyšší propustnost než BF16 při zachování více než 99% přesnosti vyhledávání BF16. Modelová karta NVFP4 také dokumentuje dynamické velikosti vkládání, což umožňuje vývojářům rozdělit 2 048-rozměrný vektor na 1 024 nebo 512 rozměrů a poté je znovu normalizovat, čímž se sníží náklady na úložiště. Tato flexibilita je důležitá pro vektorové databáze, kde je ukládání miliard vysokorozměrných vektorů drahé.
Proč na vkládání záleží právě teď
Vkládací modely se staly tichým škrticím bodem v generativním zásobníku AI. Každý agent založený na načítání, nástroj podnikového vyhledávání a asistent kódu na nich závisí, aby načetli správný kontext dříve, než velký jazykový model vygeneruje odpověď. Silnější a levnější model vkládání může přímo zlepšit kvalitu odpovědí a snížit provozní náklady, a proto prodejci od OpenAI přes Cohere až po open source kolektivy spěchali s vydáním nových rodin.
Tím, že NVIDIA nabízí opensourcing špičkově hodnocené kolekce na základě permisivní licence a spáruje ji s Blackwellem vyladěnou kvantizací, posiluje svou strategii osévání širšího ekosystému AI nástroji, které nejlépe fungují na jejím vlastním křemíku. Vývojářům, kteří budují RAG pipeline nebo systémy paměti agentů, nabízí Nemotron 3 Embed čerstvou, volně dostupnou možnost, která posouvá stav techniky na široce sledovaný benchmark, zatímco varianta NVFP4 poskytuje týmům důvěryhodnou cestu ke snížení nákladů na odvození, aniž by byla obětována kvalita vyhledávání, na které jejich aplikace závisí.
Udržujte si náskok před AI
Otevřené modely vkládání, jako je Nemotron 3 Embed, tiše přetvářejí způsob, jakým agenti AI vyhledávají a používají informace. Chcete-li se dozvědět více o modelech, verzích a výzkumu, který posouvá pole kupředu, sledujte náš [nejnovější vývoj AI] (https://aibuzzwire.news), jak se rozbíhají.
Přečtěte si další zprávy o AI ->



