Firma NVIDIA udostępniła Nemotron 3 Embed, otwartą kolekcję modeli osadzania zaprojektowanych z myślą o wspomaganiu generowania wspomaganego wyszukiwania (RAG) na skalę produkcyjną, wyszukiwania agentów, wyszukiwania kodu i pamięci agentów. Publikacja, o której szczegółowo opublikowano w MarkTechPost 17 lipca 2026 r., pojawia się, gdy warstwa decydująca o tym, które fragmenty widzi agent sztucznej inteligencji, staje się polem bitwy konkurencyjnej. Jest to trend, który podąża dział [najnowszych wiadomości o sztucznej inteligencji] (https://aibuzzwire.news) tej publikacji, gdy przedsiębiorstwa przechodzą od chatbotów do systemów działających na podstawie odzyskanej wiedzy.

Osadzanie modeli decyduje, które fragmenty widzi agent, co czyni je cichym, ale decydującym wąskim punktem w stosie generatywnej sztucznej inteligencji. NVIDIA zbudowała Nemotron 3 Embed, aby wzmocnić tę warstwę. Kolekcja obejmuje trzy otwarte punkty kontrolne: Nemotron-3-Embed-8B-BF16, opcja stawiająca na dokładność; Nemotron-3-Embed-1B-BF16, który ma tę samą konstrukcję na mniejszej powierzchni; oraz Nemotron-3-Embed-1B-NVFP4, zoptymalizowany przez firmę Blackwell wariant 4-bitowy. Wszystkie trzy to kodery transformatorowe przeszkolone w zakresie dwukierunkowego maskowania uwagi, z ostatecznym osadzeniem wytwarzanym przez średnie łączenie reprezentacji na poziomie tokena. Każdy obsługuje maksymalną długość sekwencji wynoszącą 32 768 tokenów.

Na szczycie tabeli liderów

Najważniejszym wynikiem jest to, że Nemotron-3-Embed-8B-BF16 zajmuje pierwsze miejsce w ogólnym rankingu RTEB, benchmarku Retrieval Embedding Benchmark, na dzień 17 lipca 2026 r., w odniesieniu do 16 zadań publicznych. Wyniki mierzono jako średnią NDCG@10 przy długości sekwencji modelu wynoszącej 4096. Firma NVIDIA przetestowała każdy model w 34 językach, a wszystkie trzy punkty kontrolne zostały udostępnione w ramach umowy licencyjnej OpenMDW w wersji 1.1, dzięki czemu programiści mogą je bezpłatnie pobrać, uruchomić i modyfikować.

Warto zauważyć, że podstawy modeli pochodzą z Mistrala. Według raportu MarkTechPost punkt kontrolny 8B jest zbudowany na Ministralu-3-8B-Instruct-2512, podczas gdy oba warianty 1B wykorzystują Ministral-3-3B-Instruct-2512. Decyzja firmy NVIDIA o budowaniu na fundamencie Mistral, a nie wyłącznie na własnej architekturze, odzwierciedla płynność rozwoju modeli, w której otwarte bazy są rutynowo zmieniane i przeszkolone do specjalistycznych zadań.

Kompresja, a nie mniejszy bieg treningowy

Wyróżniają się dwie luki w wydajności. Model 1B zyskuje 10,4 punktu RTEB w porównaniu z bazową wersją llama-nemotron-embed-vl-1b-v2 poprzedniej generacji. Oddzielnie 4-bitowy punkt kontrolny NVFP4 kosztuje tylko 0,38 punktu RTEB w porównaniu z jego rodzicem BF16, zachowując około 99,5% dokładności wyszukiwania. Ta niemal bezstratna kompresja jest szczególnie istotna dla zespołów, które muszą przeprowadzać osadzanie na dużą skalę, gdzie często dominują koszty pamięci i wnioskowania.

Te wyniki 1B osiągnięto dzięki rurociągowi kompresji, a nie mniejszemu przebiegowi treningowemu. Rodzica, nemotron-3-embed-3b, przycięto i destylowano w dwóch iteracyjnych rundach. Najpierw element nadrzędny 3B został przycięty do 2B przy użyciu narzędzia NVIDIA ModelOpt mcore_minitron Neural Architecture Search, które przeszukuje ukrytą szerokość, rozmiar FFN, głowy uwagi i głębokość, a następnie wybiera najlepszego kandydata z 10 najlepszych frontów Pareto. Korpus kalibracyjny obejmujący 50 000 próbek w domenie ocenił tych kandydatów.

Następnie model 2B został wydestylowany z precyzyjnie dostrojonego nauczyciela osadzania 8B, łącząc cosinusową utratę odległości i średnią kwadratową utratę błędu w wielojęzycznym połączeniu danych w domenie. Tę samą procedurę powtórzono w celu uzyskania punktu kontrolnego 1.14B, co wykazało, że mniejsze warianty dziedziczą większość możliwości większego modelu poprzez kompresję strukturalną, a nie niezależne szkolenie.

Zbudowany z myślą o wydajności Blackwell

Kompresja jest kontynuowana do formatu wyświetlania. Kwantyzacja ukierunkowana była wyłącznie na wagi i aktywacje warstw liniowych, przy użyciu typu danych NVFP4, a zespół badawczy polegał na nvidia-modelopt v0.45.0. Następnie przeprowadzono destylację uwzględniającą kwantyzację, głównie w celu odzyskania dokładności w przypadku długich danych wejściowych. Do kalibracji wykorzystano 512 próbek podzielonych na 256 zapytań i 256 fragmentów ze zbioru danych cnn_dailymail, natomiast do szkolenia QAD wykorzystano 20 000 próbek.

Praktyczną korzyścią jest wydajność najnowszego sprzętu NVIDIA. Zespół badawczy podaje, że NVFP4 na platformie Blackwell zapewnia do 2 razy większą przepustowość niż BF16, zachowując przy tym ponad 99% dokładności wyszukiwania BF16. Karta modelu NVFP4 dokumentuje również dynamiczne rozmiary osadzania, umożliwiając programistom pocięcie 2048-wymiarowego wektora do 1024 lub 512 wymiarów, a następnie ponowną normalizację, zamieniając niewielką dokładność na niższe koszty przechowywania. Ta elastyczność ma znaczenie w przypadku wektorowych baz danych, gdzie przechowywanie miliardów wielowymiarowych wektorów jest kosztowne.

Dlaczego osadzanie ma teraz znaczenie

Modele osadzania stały się cichym wąskim gardłem w stosie generatywnej sztucznej inteligencji. Każdy agent oparty na wyszukiwaniu, narzędzie wyszukiwania korporacyjnego i asystent kodu zależy od nich, aby pobrać właściwy kontekst, zanim duży model językowy wygeneruje odpowiedź. Silniejszy, tańszy model osadzania może bezpośrednio poprawić jakość odpowiedzi i obniżyć koszty operacyjne, dlatego też dostawcy od OpenAI po Cohere i kolektywy open source pośpieszyli z wypuszczeniem nowych rodzin.

Udostępniając na zasadach open source najwyżej ocenianą kolekcję w ramach liberalnej licencji i łącząc ją z kwantyzacją dostrojoną przez firmę Blackwell, NVIDIA wzmacnia swoją strategię polegającą na zaszczepianiu szerszego ekosystemu sztucznej inteligencji narzędziami, które najlepiej działają na własnym krzemie. Programistom budującym potoki RAG lub systemy pamięci agentów Nemotron 3 Embed oferuje świeżą, swobodnie dostępną opcję, która podnosi najnowocześniejsze rozwiązania w powszechnie obserwowanym benchmarku, podczas gdy wariant NVFP4 zapewnia zespołom wiarygodną ścieżkę do obniżenia kosztów wnioskowania bez poświęcania jakości wyszukiwania, od której zależą ich aplikacje.

Wyprzedź sztuczną inteligencję

Otwarte modele osadzania, takie jak Nemotron 3 Embed, po cichu zmieniają sposób, w jaki agenci AI znajdują i wykorzystują informacje. Aby uzyskać więcej informacji na temat modeli, wydań i badań, które posuwają tę dziedzinę do przodu, śledź nasze najnowsze osiągnięcia w zakresie sztucznej inteligencji, gdy się psują.

Przeczytaj więcej aktualności o sztucznej inteligencji ->