Khi trí tuệ nhân tạo chuyển từ chatbot một lượt sang các tác nhân tự động chạy liên tục, NVIDIA đang mở rộng dòng mô hình mở của mình để đáp ứng thời điểm này. Vào ngày 11 tháng 8 năm 2026, công ty đã ra mắt Nemotron 3.5 Lightning, một mô hình hỗn hợp gồm 30 tỷ thông số gồm các chuyên gia mà công ty gọi là mô hình có hiệu suất cao nhất trong phân khúc dành cho khối lượng công việc AI tác nhân dài hạn. Bản phát hành, được trình bày chi tiết trên blog NVIDIA của Kari Briski, đi kèm với NeMo Switchyard, một thư viện định tuyến nguồn mở được thiết kế để tự động chuyển từng tác vụ đến mô hình có khả năng và hiệu quả nhất về mặt chi phí. Để biết thông tin mới nhất về ngành AI, hãy theo dõi quá trình hệ thống AI tác nhân hình thành.
Một mô hình được xây dựng cho các đại lý luôn hoạt động
Các hệ thống tác nhân hiện đại ngày càng hoạt động giống như những gì NVIDIA mô tả là "hệ thống của các mô hình" hoặc tập hợp mô hình. Một mô hình lý luận biên giới như Nemotron 3 Ultra hoặc GPT-5.6 có thể lập kế hoạch và sắp xếp quy trình làm việc, trong khi các mô hình chuyên biệt nhỏ hơn xử lý các tác vụ được nhắm mục tiêu như xem xét mã, sử dụng công cụ, giám sát cảnh báo bảo mật hoặc trả lời các câu hỏi về thanh toán. Nemotron 3.5 Lightning được xây dựng có mục đích cho tầng thứ hai đó: các nhiệm vụ chuyên biệt, khối lượng lớn giúp hỗ trợ các đại lý luôn hoạt động.
Theo NVIDIA, model này mang lại tốc độ đầu ra nhanh hơn gấp 4 lần, giúp hoàn thành tác vụ tác nhân nhanh hơn khoảng 30% so với các mẫu khác cùng loại. Điểm chuẩn PinchBench của NVIDIA được cho là chứng minh rằng Nemotron 3.5 Lightning duy trì độ chính xác ở mức cao nhất trong khi hoàn thành nhiệm vụ nhanh hơn so với các thiết bị cùng loại. Mô hình này được phát triển với sự đóng góp của Liên minh Nemotron, trong đó các thành viên đã cung cấp các phương pháp đánh giá, phần mềm suy luận và bộ dữ liệu để giúp cải tiến mô hình.
Vì nó mở và có thể tùy chỉnh nên các tổ chức có thể đào tạo sau Nemotron 3.5 Lightning bằng NVIDIA NeMo trên dữ liệu miền, công cụ và quy trình làm việc của riêng họ để cải thiện độ chính xác cho các tác vụ chuyên biệt. NVIDIA cũng đang phát hành Nemotron-RL-Agentic-Terminal-Pivot, một tập dữ liệu học tăng cường tác nhân được sử dụng để đào tạo sau mô hình về các khả năng mã hóa của tác nhân.
Chạy mọi nơi, từ biên đến đám mây
Một trong những điểm bán hàng trọng tâm của Nemotron 3.5 Lightning là tính linh hoạt khi triển khai. Mô hình này có thể chạy trên các hệ thống AI cục bộ — bao gồm PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station và NVIDIA Jetson — cho phép các tổ chức tối đa hóa khoản đầu tư cơ sở hạ tầng hiện có. Nó cũng có thể mở rộng quy mô trên các thiết bị AI biên, máy trạm NVIDIA RTX PRO, trung tâm dữ liệu và môi trường đám mây cho các trường hợp sử dụng của doanh nghiệp. Tính linh hoạt đó rất quan trọng đối với các tổ chức xử lý dữ liệu nhạy cảm phải duy trì tại chỗ.
Giống như mọi lần ra mắt Nemotron, NVIDIA cho biết họ xuất bản nhiều dữ liệu và kỹ thuật đào tạo dưới dạng giấy phép cấp phép, cho phép truy xuất nguồn gốc, kiểm tra và đào tạo các mô hình khác. Cam kết về tính minh bạch này đã trở thành một điểm khác biệt mang tính cạnh tranh khi các doanh nghiệp cân nhắc các mô hình mở với các lựa chọn thay thế độc quyền mang lại ít khả năng hiển thị hơn về cách chúng được xây dựng.
NeMo Switchyard: Định tuyến thông minh cho hệ thống mô hình
Nếu Nemotron 3.5 Lightning là con ngựa thồ thì NeMo Switchyard là người điều phối. Thư viện nguồn mở tự động định tuyến các mô hình có khả năng và hiệu quả nhất cho từng bước của quy trình làm việc của tổng đài viên, dựa trên nhu cầu cụ thể. Một số mô hình tốt hơn cho việc mã hóa, một số dành cho lý luận, một số dành cho các tác vụ nhẹ và một số được tối ưu hóa để chạy cục bộ nhằm mang lại sự riêng tư và hiệu quả cao hơn. Dựa vào một mô hình mặc định duy nhất có thể đồng nghĩa với việc chi tiêu quá mức hoặc hy sinh chất lượng; Trong khi đó, việc quản lý định tuyến theo cách thủ công trở thành công việc tích hợp có thể làm chậm quá trình triển khai.
Các nhà phát triển ứng dụng đại lý có thể điều chỉnh hoặc sửa đổi bộ định tuyến bằng các thuật toán định tuyến khác nhau để phù hợp với mức độ ưu tiên của họ, chẳng hạn như các yêu cầu về chất lượng, độ trễ và chi phí. Các điểm chuẩn nội bộ của NVIDIA cho thấy NeMo Switchyard duy trì độ chính xác ở mức cao nhất trong khi giảm chi phí hoàn thành nhiệm vụ xuống gần 1/3 chỉ riêng Opus 4.8 — một mức tăng hiệu quả đáng kinh ngạc cho các tổ chức thực hiện số lượng lớn nhiệm vụ tổng đài viên.
Công ty nhấn mạnh một chuỗi tích hợp đối tác. Boomi đã báo cáo độ chính xác định tuyến tên miền là 100% và gửi 59% lưu lượng truy cập đến mô hình được tinh chỉnh nhanh hơn gấp 5 lần. Nhịp độ cải thiện hiệu quả thêm 9,9% trong trường hợp sử dụng xác minh chính thức. Cognition đã tích hợp Switchyard vào Devin Desktop, đạt được hiệu suất gần như vượt trội trên FrontierCode Main đồng thời cắt giảm chi phí trung bình 28%. LangChain báo cáo chi phí thấp hơn 74% trong 145 nhiệm vụ của Đại lý sâu nhiều lượt bằng cách chỉ định tuyến 7% cuộc gọi đến mô hình biên giới. LiteLLM đang bổ sung NeMo Switchyard làm phần bổ trợ cho lớp proxy của mình và Kong hiện cung cấp tính năng định tuyến nguyên bản thông qua Cổng AI Kong. Đáng chú ý, Nous Research đã tích hợp NeMo Switchyard vào Hermes để cung cấp cho các nhà phát triển một hệ thống định tuyến dễ cấu hình nhằm mang lại hiệu quả cho đại lý.
Sự áp dụng của ngành và Bức tranh lớn hơn
Các nhà lãnh đạo AI trong các ngành đã tùy chỉnh Nemotron 3.5 Lightning cho khối lượng công việc của họ. CrowdStrike đang áp dụng nó cho an ninh mạng, Harvey đang sử dụng nó cho các dịch vụ pháp lý và CodeRabbit đang triển khai nó để đánh giá mã. Lila Sciences đang giúp cải thiện khả năng suy luận cho các nhiệm vụ tác nhân trong khoa học vật lý và đời sống, trong khi Fastino Labs đã tùy chỉnh mô hình và báo cáo độ chính xác hàng đầu cho khối lượng công việc phát triển phần mềm, tài chính và chăm sóc sức khỏe.
Bản phát hành nhấn mạnh xu hướng rộng hơn của ngành: khi AI tự động trưởng thành, không một mô hình đơn lẻ nào có thể làm tốt mọi thứ với chi phí chấp nhận được. Tương lai thuộc về các nhóm - những người lập kế hoạch biên giới điều phối đội ngũ công nhân chuyên môn - và công cụ gắn kết họ với nhau. NVIDIA đặt cược rằng các mô hình mở và định tuyến thông minh sẽ cho phép các doanh nghiệp lắp ráp các hệ thống đó mà không cần khóa mình vào một nhà cung cấp duy nhất.
Đi trước AI
Tín hiệu Nemotron 3.5 Lightning và NeMo Switchyard của NVIDIA nơi AI tác nhân đang hướng tới: nhanh hơn, rẻ hơn, minh bạch hơn và có thể triển khai ở mọi nơi. Để cập nhật các bản phát hành mô hình và các công cụ doanh nghiệp đang định hình lại bối cảnh, hãy khám phá tin tức mới nhất về AI của chúng tôi.
Đọc thêm tin tức về AI →