NVIDIA đã phát hành Nemotron 3 Embed, một bộ sưu tập mở gồm các mô hình nhúng được thiết kế để cung cấp năng lượng cho thế hệ tăng cường truy xuất (RAG) ở quy mô sản xuất, truy xuất tác nhân, truy xuất mã và bộ nhớ tác nhân. Bản phát hành do MarkTechPost trình bày chi tiết vào ngày 17 tháng 7 năm 2026, xuất hiện dưới dạng lớp quyết định đoạn nào mà đặc vụ AI từng nhìn thấy sẽ trở thành chiến trường cạnh tranh, một xu hướng mà bàn tin tức AI mới nhất của ấn phẩm này đã theo sau khi các doanh nghiệp chuyển từ chatbot sang các hệ thống hoạt động dựa trên kiến ​​thức được truy xuất.

Các mô hình nhúng quyết định những đoạn mà tác nhân từng nhìn thấy, điều này khiến chúng trở thành điểm nghẽn yên tĩnh nhưng mang tính quyết định trong ngăn xếp AI tổng hợp. NVIDIA đã xây dựng Nemotron 3 Embed để củng cố lớp đó. Bộ sưu tập bao gồm ba điểm kiểm tra mở: Nemotron-3-Embed-8B-BF16, một tùy chọn ưu tiên độ chính xác; Nemotron-3-Embed-1B-BF16, có thiết kế tương tự nhưng có kích thước nhỏ hơn; và Nemotron-3-Embed-1B-NVFP4, một biến thể 4-bit được Blackwell tối ưu hóa. Cả ba đều là bộ mã hóa biến áp được đào tạo với mặt nạ chú ý hai chiều, với lần nhúng cuối cùng được tạo ra bằng cách gộp trung bình trên các biểu diễn cấp mã thông báo. Mỗi cái hỗ trợ độ dài chuỗi tối đa là 32.768 mã thông báo.

Đứng đầu bảng xếp hạng

Kết quả nổi bật là Nemotron-3-Embed-8B-BF16 xếp hạng tổng thể số một trên RTEB, Điểm chuẩn nhúng truy xuất, tính đến ngày 17 tháng 7 năm 2026, trong 16 nhiệm vụ công cộng của nó. Điểm được đo bằng NDCG@10 trung bình ở độ dài chuỗi mô hình là 4.096. NVIDIA đã đánh giá từng mô hình trên 34 ngôn ngữ và cả ba điểm kiểm tra đều được phát hành theo Thỏa thuận cấp phép OpenMDW phiên bản 1.1, giúp các nhà phát triển tải xuống, chạy và sửa đổi chúng miễn phí.

Đáng chú ý, các đế mô hình được lấy từ Mistral. Theo báo cáo của MarkTechPost, điểm kiểm tra 8B được xây dựng trên Ministral-3-8B-Instruct-2512, trong khi cả hai biến thể 1B đều sử dụng Ministral-3-3B-Instruct-2512. Quyết định của NVIDIA xây dựng trên nền tảng của Mistral thay vì kiến ​​trúc nội bộ thuần túy phản ánh việc phát triển mô hình linh hoạt đã trở nên trôi chảy như thế nào, với các cơ sở mở thường xuyên được tái sử dụng và đào tạo lại cho các nhiệm vụ chuyên biệt.

Nén, không phải là một buổi tập luyện nhỏ hơn

Hai khoảng cách hiệu suất nổi bật. Mô hình 1B đạt được 10,4 điểm RTEB so với đường cơ sở llama-nemotron-embed-vl-1b-v2 thế hệ trước. Riêng biệt, điểm kiểm tra 4 bit NVFP4 chỉ tốn 0,38 điểm RTEB so với điểm mẹ BF16 của nó, giữ lại khoảng 99,5% độ chính xác truy xuất của nó. Khả năng nén gần như không mất dữ liệu đó đặc biệt có ý nghĩa đối với các nhóm cần chạy các phần nhúng trên quy mô lớn, nơi chi phí bộ nhớ và suy luận thường chiếm ưu thế.

Điểm 1B đó đạt được thông qua quy trình nén thay vì quá trình đào tạo nhỏ hơn. Cha mẹ, nemotron-3-embed-3b, được cắt tỉa và chưng cất qua hai vòng lặp. Đầu tiên, cấp độ gốc 3B được rút gọn thành 2B bằng cách sử dụng Tìm kiếm Kiến trúc Thần kinh mcore_minitron của NVIDIA ModelOpt, tìm kiếm theo chiều rộng ẩn, kích thước FFN, mức độ chú ý và độ sâu, sau đó chọn ứng cử viên tốt nhất từ ​​10 mặt trận Pareto hàng đầu. Một kho dữ liệu hiệu chuẩn trong miền gồm 50.000 mẫu đã chấm điểm các ứng viên đó.

Tiếp theo, mô hình 2B được chắt lọc từ giáo viên nhúng 8B đã tinh chỉnh, kết hợp mất khoảng cách cosine và mất lỗi bình phương trung bình qua hỗn hợp dữ liệu trong miền, đa ngôn ngữ. Quy trình tương tự được lặp lại để tạo ra điểm kiểm tra 1.14B, chứng minh rằng các biến thể nhỏ hơn kế thừa phần lớn khả năng của mô hình lớn hơn thông qua nén có cấu trúc thay vì đào tạo độc lập.

Được xây dựng để mang lại hiệu quả cho Blackwell

Quá trình nén tiếp tục chuyển sang định dạng phục vụ. Trọng số mục tiêu lượng tử hóa và chỉ kích hoạt các lớp tuyến tính, sử dụng kiểu dữ liệu NVFP4, trong khi nhóm nghiên cứu dựa vào nvidia-modelopt v0.45.0. Tiếp theo là quá trình chưng cất lượng tử hóa-nhận biết, chủ yếu để khôi phục độ chính xác trên các đầu vào dài. Quá trình hiệu chuẩn đã sử dụng 512 mẫu, phân chia thành 256 truy vấn và 256 đoạn từ tập dữ liệu cnn_dailymail, trong khi quá trình đào tạo QAD thu hút 20.000 mẫu.

Phần thưởng thực tế là hiệu quả trên phần cứng mới nhất của NVIDIA. Nhóm nghiên cứu báo cáo rằng NVFP4 trên Blackwell mang lại thông lượng cao hơn tới 2 lần so với BF16 trong khi vẫn giữ được hơn 99% độ chính xác truy xuất BF16. Thẻ mô hình NVFP4 cũng ghi lại các kích thước nhúng động, cho phép các nhà phát triển cắt vectơ 2.048 chiều xuống còn 1.024 hoặc 512 kích thước và chuẩn hóa lại sau đó, đánh đổi một chút độ chính xác để có chi phí lưu trữ thấp hơn. Tính linh hoạt đó rất quan trọng đối với cơ sở dữ liệu vectơ, nơi việc lưu trữ hàng tỷ vectơ chiều cao rất tốn kém.

Tại sao nhúng lại quan trọng bây giờ

Các mô hình nhúng đã trở thành một điểm nghẽn yên tĩnh trong hệ thống AI tổng hợp. Mọi tác nhân dựa trên truy xuất, công cụ tìm kiếm doanh nghiệp và trợ lý mã đều phụ thuộc vào chúng để tìm nạp ngữ cảnh phù hợp trước khi mô hình ngôn ngữ lớn tạo ra phản hồi. Một mô hình nhúng mạnh hơn, rẻ hơn có thể trực tiếp cải thiện chất lượng câu trả lời và cắt giảm chi phí vận hành, đó là lý do tại sao các nhà cung cấp từ OpenAI đến Cohere cho đến các tập thể nguồn mở đã gấp rút tung ra các dòng sản phẩm mới.

Bằng cách cung cấp nguồn mở cho một bộ sưu tập được xếp hạng hàng đầu theo giấy phép cho phép và kết hợp nó với lượng tử hóa do Blackwell điều chỉnh, NVIDIA đang củng cố chiến lược gieo mầm hệ sinh thái AI rộng lớn hơn bằng các công cụ chạy tốt nhất trên silicon của riêng mình. Đối với các nhà phát triển đang xây dựng đường dẫn RAG hoặc hệ thống bộ nhớ tác nhân, Nemotron 3 Embed cung cấp một tùy chọn mới, có sẵn miễn phí nhằm nâng cao công nghệ tiên tiến trên một tiêu chuẩn được theo dõi rộng rãi, trong khi biến thể NVFP4 cung cấp cho các nhóm một con đường đáng tin cậy để cắt giảm chi phí suy luận mà không ảnh hưởng đến chất lượng truy xuất mà ứng dụng của họ phụ thuộc vào.

Đi trước AI

Các mô hình nhúng mở như Nemotron 3 Embed đang âm thầm định hình lại cách các tác nhân AI tìm và sử dụng thông tin. Để biết thêm về các mô hình, bản phát hành và nghiên cứu thúc đẩy lĩnh vực này phát triển, hãy theo dõi những phát triển AI mới nhất của chúng tôi khi chúng được phát triển.

Đọc thêm tin tức về AI ->