Các nhà nghiên cứu của Nvidia đã xây dựng một hệ thống tác nhân giúp Claude Opus 5 của Anthropic đạt điểm hoàn hảo 100% trên ARC-AGI-3, một trong những tiêu chuẩn lý luận tương tác đòi hỏi khắt khe nhất trong AI — sử dụng chính mô hình đạt 30% khi nó tự chạy. Kết quả, được công bố hôm thứ Sáu trên Blog kỹ thuật Nvidia, là bằng chứng mạnh mẽ nhất cho thấy phần mềm bao quanh một mô hình biên giới cũng quan trọng như chính mô hình đó. Đối với bất kỳ ai theo dõi những phát triển AI mới nhất, điều này đánh dấu sự thay đổi về lợi thế cạnh tranh trong AI tác nhân thực sự tồn tại.

Hệ thống này được gọi là AVO, viết tắt của Toán tử biến đổi tác nhân và Nvidia sử dụng kiến ​​trúc có mục đích chung dành cho các tác nhân tự trị có tầm nhìn dài — AI có thể thực hiện nhiệm vụ trong nhiều giờ hoặc nhiều ngày thay vì trả lời một lời nhắc duy nhất. Trên tập hợp công khai ARC-AGI-3, AVO đã ghi được điểm 100,00 RHAE trên tất cả 25 môi trường trò chơi, hoàn thành tất cả 183 cấp độ trong 6.624 hành động môi trường bằng cách sử dụng Claude Opus 5 làm mô hình phụ trợ.

ARC-AGI-3 thực sự kiểm tra điều gì

ARC-AGI-3 là một chuẩn mực lý luận tương tác được tạo ra bởi tổ chức ARC Prize. Một đặc vụ bị rơi vào những môi trường xa lạ, giống như trò chơi mà không có hướng dẫn, không có quy tắc cụ thể và không có mục tiêu cụ thể. Nó phải khám phá bằng cách thử và sai, suy ra cách môi trường hoạt động, tìm ra "chiến thắng" nghĩa là gì và sau đó hành động đủ hiệu quả để vượt qua các cấp độ ngày càng khó hơn.

Chỉ số chấm điểm của điểm chuẩn, Hiệu quả hành động tương đối của con người (RHAE), kết hợp việc hoàn thành nhiệm vụ với số hành động mà tác nhân lãng phí so với những người chơi lần đầu là con người. Điều đó khiến nó trở thành một bài kiểm tra tàn bạo về quyền tự chủ bền vững: tác nhân phải ghi nhớ những gì đã học được, khắc phục sau sai lầm và lập ngân sách cho các hành động của mình một cách cẩn thận trong toàn bộ quá trình.

Số tiêu đề của Nvidia lấy bối cảnh từ một so sánh. VISTA, một hệ thống khai thác tương tác trực tiếp trước đây cũng sử dụng Claude Opus 5, đã hoàn thành 183 cấp độ do công chúng đặt ra tương tự trong 7.542 hành động môi trường. Theo bài đăng trên blog của Nvidia, AVO cần ít hành động hơn khoảng 12% để hoàn thành công việc.

Từ hạt nhân GPU đến trò chơi không xác định

AVO không được xây dựng để giải đố. Nvidia lần đầu tiên trình diễn kiến ​​trúc về tối ưu hóa hạt nhân GPU, một miền mà những thay đổi nhỏ về mã có thể phá vỡ tính chính xác, hành vi bộ nhớ và thông lượng theo những cách không thể đoán trước. Trong một nghiên cứu về hạt nhân chú ý, AVO chạy liên tục trong bảy ngày, khám phá hơn 500 hướng tối ưu hóa và dành riêng 40 phiên bản hạt nhân. Trên các hệ thống NVIDIA DGX B200, hạt nhân chú ý nhiều đầu thu được vượt trội hơn cuDNN tới 3,5% và FlashAttention-4 tới 10,5%. Sau đó, tác nhân đã điều chỉnh nhân đã phát triển của mình để phù hợp với sự chú ý của truy vấn được nhóm trong khoảng 30 phút thực hiện công việc tự chủ bổ sung.

Vòng lặp cốt lõi tương tự — kiểm tra, lập kế hoạch, triển khai, kiểm tra, đánh giá — sau đó được chỉ vào ARC-AGI-3 với giao diện tác vụ chỉ thay đổi. Hai cơ chế được chuyển tiếp. Đầu tiên là bộ nhớ liên tục, lưu trữ các hoạt động triển khai trước đó, kết quả đánh giá, đầu ra của trình biên dịch và trình lược tả cũng như lý luận tích lũy, do đó tác nhân có thể tiếp tục từ trạng thái hiện tại thay vì xây dựng lại bối cảnh từ đầu. Người thứ hai là người giám sát, người thứ hai theo dõi quỹ đạo tổng thể và can thiệp khi tiến độ bị đình trệ.

##Người Giám Sát Là Người Đột Phá

TechCrunch, người đã phỏng vấn Adel El Hallak của Nvidia, phó chủ tịch sản phẩm bộ phận AI của công ty, đã nhấn mạnh người giám sát là thành phần quan trọng nhất. El Hallak nói với ấn phẩm: “Nó gần như hoạt động giống như một CEO để thúc đẩy đại lý khi nó đi chệch hướng hoặc bắt đầu khám phá một con đường có thể dẫn đến ngõ cụt hoặc khám phá lại con đường mà nó đã đi trước đó”.

Khoảng cách hiệu suất là rõ ràng. Thử nghiệm của Nvidia cho thấy Claude Opus 5 không có dây nịt phức tạp đạt được 30% điểm trên ARC-AGI-3 — kết quả tốt nhất trong số các mẫu trần được thử nghiệm, nhưng chưa đạt đến mức chạy hoàn toàn. Các mô hình của OpenAI đã đạt điểm chuẩn dưới 10% và công ty đã công bố nghiên cứu của riêng mình vào tháng trước cho thấy rằng chỉ cần điều chỉnh hai cài đặt dây nịt đã tăng gấp ba điểm số của họ. Không có cấu hình chỉ dành cho kiểu máy nào đạt được gần 100% mà AVO đạt được.

Đáng chú ý, cấu hình AVO chạy ở chế độ chỉ văn bản: mỗi quan sát được cung cấp dưới dạng lưới văn bản 64x64 chính xác, không có hình ảnh hoặc mã thông báo hình ảnh nào được gửi đến mô hình. Sức mạnh lý luận đến từ vòng lặp xung quanh mô hình chứ không phải từ nhận thức đa phương thức.

Tại sao ngành lại đặt cược vào khai thác

Phát hiện này diễn ra trong bối cảnh có làn sóng bằng chứng cho thấy cơ sở hạ tầng tác nhân chứ không phải khả năng của mô hình thô mới là nút thắt hiện tại đối với AI tự trị. Databricks đã công bố nghiên cứu điểm chuẩn vào tháng 7 cho thấy rằng dây nịt tác động đáng kể đến cả hiệu suất và chi phí. Ali Ghodsi, Giám đốc điều hành của Databricks, nói với TechCrunch: “Bạn có thể chọn cùng một mẫu nhưng dây nịt khác nhau và bạn sẽ phải trả nhiều chi phí hơn đáng kể nếu sử dụng sai dây nịt”. "Bản thân điều đó có thể khiến chi phí của bạn tăng gấp đôi."

El Hallak đưa ra lập luận rộng hơn của Nvidia về tính cởi mở. Ông nói: “Chúng tôi tin rằng việc có một nhóm tác nhân mở — nơi bạn có quyền kiểm soát trên toàn bộ khai thác, trên cơ sở hạ tầng, trong suốt thời gian chạy — là điều cần thiết để chúng tôi đưa hệ sinh thái tiến lên phía trước và an toàn”. Nvidia có các công nghệ khai thác có kích thước mở dưới thương hiệu NeMo của mình và nghiên cứu AVO được ghi lại trong một bài báo trên arXiv.

Một điểm chuẩn có lịch sử

ARC-AGI-3 đã trở thành điểm sáng trong cuộc cạnh tranh giữa các phòng thí nghiệm biên giới. OpenAI trước đây đã tuyên bố kết quả tốt cho mẫu GPT-5.6 Sol của mình trên điểm chuẩn, thu hút sự xem xét kỹ lưỡng đối với các cài đặt đánh giá được sử dụng. Kết quả của Nvidia vượt qua cuộc tranh luận đó theo một nghĩa nào đó - nó không yêu cầu một mô hình thông minh hơn, chỉ yêu cầu một tác nhân được thiết kế tốt hơn xung quanh mô hình hiện có.

Thông điệp dành cho các nhà phát triển và doanh nghiệp xây dựng các sản phẩm đại diện là trực tiếp: việc lựa chọn mô hình vẫn quan trọng, nhưng thiết kế hệ thống hiện quyết định liệu mô hình tiên phong có mang lại kết quả tiên phong hay không. Như Nvidia đã nói, việc đánh giá một mô hình không giống như đánh giá một tác nhân — và các bảng điểm chuẩn của năm 2026 ngày càng bổ ích cho các kỹ sư xây dựng giàn giáo.

Đi trước AI

Kiến trúc tác nhân đang phát triển nhanh hơn bao giờ hết và khoảng cách giữa dây nịt tốt và dây nịt kém hiện được đo bằng điểm chuẩn và đô la thực. Theo dõi AI Buzz Wire để biết tin tức hàng ngày, được xác minh nguồn về nghiên cứu AI, điểm chuẩn và ra mắt sản phẩm.

Đọc thêm tin tức nghiên cứu AI →