NVIDIA는 생산 규모의 검색 증강 생성(RAG), 에이전트 검색, 코드 검색 및 에이전트 메모리를 지원하도록 설계된 공개 임베딩 모델 컬렉션인 Nemotron 3 Embed를 출시했습니다. 2026년 7월 17일 MarkTechPost에서 자세히 설명한 이 릴리스는 AI 에이전트가 볼 수 있는 구절을 결정하는 계층이 경쟁적인 전쟁터가 되면서 도착합니다. 이는 기업이 챗봇에서 검색된 지식에 따라 작동하는 시스템으로 이동함에 따라 이 출판물의 속보 AI 뉴스 데스크가 따라온 추세입니다.
임베딩 모델은 에이전트가 볼 수 있는 구절을 결정하므로 생성 AI 스택에서 조용하지만 결정적인 관문이 됩니다. NVIDIA는 해당 계층을 강화하기 위해 Nemotron 3 Embed를 구축했습니다. 컬렉션에는 3개의 공개 체크포인트가 포함되어 있습니다. 정확도 우선 옵션인 Nemotron-3-Embed-8B-BF16; 동일한 디자인을 더 작은 설치 공간에 적용하는 Nemotron-3-Embed-1B-BF16 Blackwell에 최적화된 4비트 변형인 Nemotron-3-Embed-1B-NVFP4도 있습니다. 세 가지 모두 양방향 주의 마스킹으로 훈련된 변환기 인코더이며, 최종 임베딩은 토큰 수준 표현에 대한 평균 풀링을 통해 생성됩니다. 각각은 32,768개 토큰의 최대 시퀀스 길이를 지원합니다.
리더보드 1위 차지
헤드라인 결과는 Nemotron-3-Embed-8B-BF16이 2026년 7월 17일 현재 16개 공개 작업 전반에 걸쳐 검색 임베딩 벤치마크인 RTEB에서 전체 1위를 차지했다는 것입니다. 점수는 모델 시퀀스 길이 4,096에서 평균 NDCG@10으로 측정됩니다. NVIDIA는 34개 언어로 각 모델을 평가했으며 세 가지 체크포인트가 모두 OpenMDW 라이센스 계약 버전 1.1에 따라 출시되어 개발자가 무료로 다운로드, 실행 및 수정할 수 있습니다.
특히 모델 베이스는 Mistral에서 가져온 것입니다. MarkTechPost 보고서에 따르면 8B 체크포인트는 Ministral-3-8B-Instruct-2512를 기반으로 구축되었으며 두 1B 변형 모두 Ministral-3-3B-Instruct-2512를 사용합니다. 순수한 내부 아키텍처가 아닌 Mistral의 기반을 기반으로 구축하기로 한 NVIDIA의 결정은 개방형 기반이 전문 작업을 위해 일상적으로 용도가 변경되고 재교육되면서 어떻게 유동적인 모델 개발이 되었는지를 반영합니다.
소규모 훈련 실행이 아닌 압축
두 가지 성능 격차가 두드러집니다. 1B 모델은 이전 세대 llama-nemotron-embed-vl-1b-v2 기준에 비해 10.4 RTEB 포인트를 얻습니다. 이와 별도로 NVFP4 4비트 체크포인트는 BF16 상위 항목에 비해 RTEB 포인트가 0.38점에 불과하며 검색 정확도의 약 99.5%를 유지합니다. 거의 무손실에 가까운 압축은 메모리 및 추론 비용이 대부분 차지하는 대규모 임베딩을 실행해야 하는 팀에 특히 중요합니다.
이러한 1B 점수는 소규모 교육 실행이 아닌 압축 파이프라인을 통해 달성되었습니다. 부모인 nemotron-3-embed-3b는 두 번의 반복 라운드에 걸쳐 가지치기 및 증류되었습니다. 먼저, 숨겨진 너비, FFN 크기, 주의 헤드 및 깊이를 검색한 다음 상위 10개 파레토 전선에서 가장 적합한 후보를 선택하는 NVIDIA ModelOpt의 mcore_minitron 신경 아키텍처 검색을 사용하여 3B 상위 항목을 2B로 정리했습니다. 50,000개의 샘플로 구성된 도메인 내 교정 코퍼스가 해당 후보자의 점수를 매겼습니다.
다음으로, 2B 모델은 미세 조정된 8B 임베딩 교사로부터 추출되어 다국어 도메인 내 데이터 혼합에 대한 코사인 거리 손실과 평균 제곱 오류 손실을 결합했습니다. 1.14B 체크포인트를 생성하기 위해 동일한 절차가 반복되었으며, 이는 더 작은 변형이 독립적인 훈련이 아닌 구조화된 압축을 통해 더 큰 모델의 기능을 상당 부분 상속한다는 것을 보여줍니다.
Blackwell 효율성을 위해 제작됨
압축은 제공 형식으로 계속됩니다. 연구팀은 nvidia-modelopt v0.45.0을 사용하여 NVFP4 데이터 유형을 사용하여 선형 레이어의 활성화 및 양자화 목표 가중치를 적용했습니다. 주로 긴 입력의 정확도를 복구하기 위해 양자화 인식 증류(Quantization-Aware Distillation)가 이어졌습니다. 보정에는 512개의 샘플이 사용되었으며, cnn_dailymail 데이터 세트의 256개의 쿼리와 256개의 구절로 분할되었으며, QAD 교육에서는 20,000개의 샘플이 사용되었습니다.
실질적인 보상은 NVIDIA 최신 하드웨어의 효율성입니다. 연구팀은 Blackwell의 NVFP4가 BF16 검색 정확도를 99% 이상 유지하면서 BF16보다 최대 2배 더 높은 처리량을 제공한다고 보고합니다. NVFP4 모델 카드는 또한 동적 임베딩 크기를 문서화하므로 개발자는 2,048차원 벡터를 1,024 또는 512차원으로 분할하고 나중에 다시 정규화하여 스토리지 비용을 낮추기 위해 약간의 정확성을 교환할 수 있습니다. 수십억 개의 고차원 벡터를 저장하는 데 비용이 많이 드는 벡터 데이터베이스의 경우 이러한 유연성이 중요합니다.
지금 임베딩이 중요한 이유
임베딩 모델은 생성 AI 스택에서 조용한 관문이 되었습니다. 모든 검색 기반 에이전트, 엔터프라이즈 검색 도구 및 코드 도우미는 대규모 언어 모델이 응답을 생성하기 전에 올바른 컨텍스트를 가져오는 데 의존합니다. 더 강력하고 저렴한 임베딩 모델은 답변 품질을 직접적으로 향상시키고 운영 비용을 절감할 수 있습니다. 이것이 바로 OpenAI에서 Cohere, 오픈 소스 집단에 이르기까지 공급업체가 새로운 제품군을 출시하기 위해 서두르고 있는 이유입니다.
허용된 라이선스에 따라 최고 수준의 컬렉션을 오픈 소스화하고 이를 Blackwell이 조정한 양자화와 결합함으로써 NVIDIA는 자체 실리콘에서 가장 잘 실행되는 도구를 사용하여 더 넓은 AI 생태계를 구축하려는 전략을 강화하고 있습니다. RAG 파이프라인 또는 에이전트 메모리 시스템을 구축하는 개발자를 위해 Nemotron 3 Embed는 널리 시청되는 벤치마크에서 최첨단 기술을 적용하는 새롭고 무료로 사용 가능한 옵션을 제공하는 반면, NVFP4 변형은 애플리케이션이 의존하는 검색 품질을 희생하지 않고 추론 비용을 절감할 수 있는 신뢰할 수 있는 경로를 팀에 제공합니다.
AI보다 앞서 나가세요
Nemotron 3 Embed와 같은 개방형 임베딩 모델은 AI 에이전트가 정보를 찾고 사용하는 방식을 조용히 재편하고 있습니다. 해당 분야를 발전시키는 모델, 릴리스 및 연구에 대한 자세한 내용을 보려면 최신 AI 개발을 팔로우하세요.
AI 뉴스 자세히 보기 ->



