Một nhóm nghiên cứu từ FAIR tại Meta, Đại học Oxford và Đại học London đã giới thiệu Mô hình ưu tiên nghiên cứu AI (RPM), một phương pháp để quyết định thử nghiệm học máy nào mà một tác nhân nghiên cứu tự trị thực sự nên chạy. Theo báo cáo của MarkTechPost về công việc, thay vì dự đoán thử nghiệm sẽ đạt điểm như thế nào, RPM sẽ xếp hạng các ứng cử viên chưa được thực hiện và chọn ra ứng cử viên có triển vọng nhất, một sự thay đổi mà nhóm cho biết đã giải quyết được nút thắt thực sự trong nghiên cứu do AI điều khiển: tính toán xác minh.
Ý tưởng này xuất hiện vào thời điểm các cơ quan nghiên cứu có thể đề xuất, thực hiện và chấm điểm các thí nghiệm của riêng họ. Việc tạo ra ý tưởng rất rẻ; việc thực thi thì không. Việc đào tạo một ứng viên có thể tiêu tốn hàng giờ đến hàng ngày thời gian của GPU, do đó, một nhân viên chắc chắn sẽ đề xuất nhiều thử nghiệm hơn mức họ có thể thực hiện. Theo nhóm xác định, những ứng viên nào được thực hiện là đòn bẩy thực sự đối với tiến độ nghiên cứu. Đối với các phòng thí nghiệm đang chứng kiến chi phí điện toán của họ ngày càng tăng, cơ cấu đó chính xác là lý do tại sao công việc này đang thu hút sự chú ý qua những phát triển AI mới nhất trong tự động hóa nghiên cứu.
Tại sao việc lựa chọn thử nghiệm lại là điểm nghẽn
Nhóm nhận thấy rằng các mô hình ngôn ngữ không đáng tin cậy trong việc dự đoán các số liệu tuyệt đối hoặc kết quả thực thi. Một mô hình không thể nhìn vào một thí nghiệm ứng cử viên và dự đoán chính xác số điểm mà nó sẽ đạt được. Các nhà nghiên cứu nhận thấy những gì nó có thể làm là đánh giá xem ai trong số hai ứng cử viên là người đặt cược tốt hơn - một sự so sánh tương đối hơn là một dự đoán tuyệt đối. RPM được xây dựng hoàn toàn dựa trên sự khác biệt đó: chúng không bao giờ dự đoán điểm số mà chỉ xếp hạng.
Hệ thống này chạy bên trong AIRA-dojo, một giàn tìm kiếm cây tiến hóa mã nguồn mở tạo ra các thử nghiệm máy học thông qua lựa chọn cha mẹ tham lam và các toán tử Dự thảo, Cải thiện và Gỡ lỗi, trả về nút có điểm xác thực cao nhất ở cuối. Điểm chuẩn, AIRS-Bench, cũng là nguồn mở. Cả giàn giáo và mô hình ưu tiên đều sử dụng Qwen3.6-27B làm xương sống, điều mà nhóm lưu ý là trọng lượng mở.
Giải đấu loại trực tiếp diễn ra như thế nào
Thay vì tạo ra một thử nghiệm con và thực hiện nó, tác nhân áp dụng một toán tử song song 15 lần để tạo ra 15 ứng cử viên chưa được thực hiện. Sau đó, RPM sẽ so sánh họ theo từng cặp trong một giải đấu loại trực tiếp và chỉ người chiến thắng mới được xử tử. Mỗi so sánh dựa trên các nút ngữ cảnh được thu thập bằng bước đi đầu tiên của cây đã khám phá, với mỗi ứng cử viên được hiển thị cùng với điểm xác thực của tổ tiên của nó, do đó, đánh giá sẽ suy luận từ lịch sử tìm kiếm thực tế của tác nhân chứ không phải trong chân không.
Bài viết mô tả hai biến thể với ngân sách tính toán khác nhau:
- RPM chỉ suy luận — LLM với tư cách là người đánh giá so sánh các kế hoạch, mã và lịch sử tìm kiếm của ứng viên trong một lần duy nhất. Lời nhắc của nó đã được tối ưu hóa với MIPROv2 từ khung DSPy và hội tụ vào cái mà nhóm gọi là phiếu tự đánh giá dành cho người điều tra chính: nó chấp nhận các lỗi có thể sửa được, khen thưởng khả năng mở rộng và phạt các hướng nghiên cứu dư thừa. Độ chính xác so sánh ngoại tuyến đo được từ 57,7 đến 59,0%.
- RPM tác nhân — cùng một thẩm phán cộng với hộp cát sao chép môi trường của tác nhân, bao gồm một GPU H200 duy nhất, với các công cụ được giới hạn ở Python, Bash và hành động gửi giải pháp. Nó chạy các thử nghiệm thí điểm quy mô nhỏ, sau đó mô hình phản hồi đề xuất thử nghiệm tiếp theo có nhiều thông tin nhất hoặc kết thúc vòng lặp. Phi công được giới hạn ở mức 30 với ngưỡng 60 giây và quỹ thời gian còn lại được cố tình phóng đại — 2.700 giây được báo cáo so với 300 giây thực — vì vậy, nhân viên hỗ trợ không ngừng tối ưu hóa sớm.
Một thẩm phán được điều chỉnh như một điều tra viên chính
Việc đóng khung người điều tra chính là phần thú vị một cách lặng lẽ. Thay vì khen thưởng những ứng viên trông cực kỳ ấn tượng, thang đánh giá được tối ưu hóa phản ánh cách một nhà nghiên cứu có kinh nghiệm phân loại các ý tưởng: mã có lỗi có thể được sửa chữa, mã đánh bóng theo đuổi ngõ cụt và các hướng sao chép cây hiện có có giá trị thấp hơn các hướng mới. Phiếu tự đánh giá đó, được học thông qua tối ưu hóa nhanh chóng thay vì điều chỉnh bằng tay, chính là yếu tố mang lại sự cải tiến, sự cắt bỏ của nhóm cho thấy.
Kết quả Benchmark trên AIRS-Bench
Việc đánh giá bao gồm 20 nhiệm vụ dạng văn bản và dạng bảng công khai, với mỗi nhiệm vụ được thực hiện trong 24 giờ trên một H200 và 10 hạt giống ngẫu nhiên. Điều quan trọng là, cùng một đường trục Qwen3.6-27B hỗ trợ cả người vận hành thử nghiệm và mô hình ưu tiên, do đó lợi ích đến từ lớp lựa chọn thay vì mô hình đánh giá mạnh hơn. Điểm chuẩn hóa trung bình:
- Không có RPM (chọn ngẫu nhiên): 0,684
- RPM chỉ suy luận: 0,711
- RPM tác nhân: 0,729
- Xác thực oracle (trần): 0,748
- Kiểm tra oracle (trần): 0,759
Xác suất cải thiện so với lựa chọn ngẫu nhiên là 0,5923 đối với biến thể chỉ suy luận và 0,5913 đối với biến thể tác nhân, với giới hạn dưới khoảng tin cậy 95% là 0,5066 và 0,5018 – trên ngưỡng 0,5 đối với ý nghĩa thống kê, mặc dù nhóm thẳng thắn rằng tỷ suất lợi nhuận rất khiêm tốn chứ không phải là biến đổi.
Hiệu quả là kết quả thiết thực hơn. RPM chỉ suy luận đã đạt điểm cuối cùng của đường cơ sở ngẫu nhiên là 0,684 trong 14,88 giờ, tăng tốc 1,61 lần, trong khi biến thể tác nhân cần 15,50 giờ, tăng tốc 1,55 lần. Ngay cả khi tính đến chi phí suy luận của thẩm phán tự tổ chức, các con số được điều chỉnh vẫn thuận lợi.
Trọng lượng mở và những lời cảnh báo trung thực
Nhóm đã thẳng thắn nói rằng hôm nay RPM chỉ có thể triển khai được một phần. Các thành phần là mở — các xương sống được huấn luyện trước đông lạnh không có tinh chỉnh, giàn giáo và điểm chuẩn nguồn mở cũng như các mô hình xương sống có trọng lượng mở — nhưng yêu cầu về hộp cát của biến thể tác nhân và chi phí thử nghiệm thí điểm của nó có nghĩa là hầu hết các phòng thí nghiệm sẽ bắt đầu với phiên bản chỉ suy luận. Các nhà nghiên cứu cũng lưu ý rằng các bước gỡ lỗi sẽ hoàn nguyên về lựa chọn ngẫu nhiên trong biến thể của tác nhân vì thời gian của phi công cạnh tranh với đồng hồ của chính tác nhân.
Ý nghĩa lớn hơn có thể mang tính định hướng. Khi các tác nhân nghiên cứu tự động chuyển từ bản demo sang sử dụng hàng ngày trong các phòng thí nghiệm công nghiệp, nguồn lực khan hiếm không còn là ý tưởng mà là số giờ GPU và các phương pháp giúp đạt được nhiều tiến bộ hơn từ ngân sách tính toán cố định theo thời gian. Xếp hạng trước khi chạy là một ý tưởng đơn giản và các số liệu AIRS-Bench cho thấy đây là một ý tưởng hoạt động đủ tốt để trở thành vấn đề quan trọng.
Đi trước AI
Theo dõi nghiên cứu đang định hình các mô hình của tương lai tại AI Buzz Wire.
Đọc thêm tin tức về AI →