Sakana AI đã xuất bản "Beyond Imitation", một bài nghiên cứu trên tạp chí Giao dịch về Nghiên cứu Học máy (TMLR) mô tả một hệ thống đánh giá ngang hàng được hỗ trợ bởi LLM được xây dựng dựa trên việc phát hiện lỗi thay vì bắt chước các đánh giá của con người, MarkTechPost đưa tin vào ngày 10 tháng 10. Câu hỏi trọng tâm mà phòng thí nghiệm có trụ sở tại Tokyo đặt ra là trả lời: thay vì chấm điểm cho người đánh giá AI về mức độ kết quả đầu ra của nó khớp với đánh giá của con người, liệu nó có thể tìm ra lỗi cố ý không?
Nhóm đã vận chuyển hai hiện vật: Điểm chuẩn mâu thuẫn để đo lường khả năng phát hiện lỗi và hệ thống Đánh giá nhiều lớp (MLR) dẫn đầu mọi đường cơ sở được kiểm tra. Kết quả đạt được trong bối cảnh mối quan tâm ngày càng tăng đối với việc sử dụng AI để củng cố quá trình đánh giá ngang hàng – một quá trình đang chịu áp lực do số lượng bài nộp ngày càng tăng. Để biết thêm về cách AI đang định hình lại hoạt động nghiên cứu, hãy theo dõi sự phát triển AI mới nhất của chúng tôi.
Điểm chuẩn của những sai lầm đã gieo trồng
Điểm chuẩn Mâu thuẫn đưa các lỗi vào bài viết thực và kiểm tra xem người đánh giá có phát hiện được chúng hay không. Các nhà nghiên cứu đã thu thập 257 bài báo được cấp phép CC từ ACL, AISTATS, CVPR và ICML 2025, cùng với NeurIPS 2024, sau đó sử dụng Gemini 2.5 Pro để xây dựng biểu đồ tri thức về các tuyên bố, bằng chứng và phương pháp của từng bài báo.
Mức độ nghiêm trọng được xác định một cách có cấu trúc: khoảng cách từ nút đến "yêu cầu chính" của bài báo xác định mức độ nghiêm trọng của lỗi. Khoảng cách bằng 0 đạt được yêu cầu cốt lõi; khoảng cách lớn hơn chạm tới các chi tiết hỗ trợ. GPT-4.1 sau đó viết lại một nút trên mỗi khoảng cách thành một mâu thuẫn, tạo ra tổng cộng 1.164 điểm dữ liệu. Một giám khảo o3 cho điểm mỗi bài đánh giá mười lần. Trên các giấy tờ sạch, thẩm phán đạt độ chính xác 99,9% và nó cho thấy độ nhạy 86,8% đối với các sản phẩm đánh bắt được xác nhận thủ công - có nghĩa là điểm phát hiện được báo cáo thực sự có thể ở mức vừa phải.
Cách hoạt động của Đánh giá nhiều lớp
MLR là một hệ thống tác nhân hiểu bài viết trước khi phê bình nó, được tập hợp từ ba tác nhân chuyên biệt chạy trên các mô hình Claude có sẵn — không cần cụm GPU và không cần tinh chỉnh:
- Phụ lục Agent (Claude Haiku 3.5): tóm tắt thí nghiệm và chi tiết triển khai từ phụ lục.
- Cơ quan đánh giá tài liệu (Claude Sonnet 4, tùy chọn): sử dụng tìm kiếm trên web để đặt bài báo vào bối cảnh của tác phẩm trước đó.
- Tác nhân đánh giá (Claude Sonnet 4): chạy chuỗi nhắc nhở ba bước lấy cảm hứng từ "Phương pháp tiếp cận ba bước" nổi tiếng của nhà khoa học máy tính S. Keshav — đầu tiên là một bản phác thảo cấp cao, sau đó là đọc chi tiết gắn cờ các điểm yếu, giả định và khoảng trống, và cuối cùng là hợp nhất tất cả các kết quả đầu ra của tác nhân thành điểm mạnh, điểm yếu, câu hỏi, đề xuất, điểm số và danh sách việc cần làm.
Tệp PDF được chuyển trực tiếp đến các mô hình, do đó các số liệu và phương trình vẫn tồn tại trong quá trình xử lý. Hệ thống đọc tối đa 10 trang văn bản chính và Sakana ước tính chi phí vào khoảng 0,47 USD cho mỗi lần xem xét.
Kết quả: Lựa chọn thiết kế và mẫu mã đều quan trọng
MLR dẫn đầu cả bốn hệ thống được thử nghiệm trên điểm chuẩn. Với bốn đánh giá độc lập, nó đã giải quyết được 73,43% mâu thuẫn cốt lõi (khoảng cách bằng 0) và 40,95% tổng thể. Đường cơ sở tốt nhất, một hệ thống có tên AgentReview, chỉ quản lý được 14,81% các khiếu nại cốt lõi. Ngay cả một đánh giá MLR cũng phát hiện được 60,79% lỗi xác nhận quyền sở hữu cốt lõi.
Một nghiên cứu cắt bỏ tách biệt sự đóng góp của thiết kế với việc lựa chọn mô hình. Việc hoán đổi GPT-4.1 lấy Claude Sonnet 4 trong quy trình đánh giá hiện tại đã nâng khả năng phát hiện khiếu nại cốt lõi từ 14,56% lên 35,40%, trong khi thiết kế đa tác nhân của MLR đã tăng thêm khoảng 25 điểm phần trăm cho một lần đánh giá. Độ chính xác của việc phát hiện giảm khi các lỗi di chuyển ra khỏi tuyên bố chính, điều mà các tác giả cho rằng hỗ trợ cho việc chấm điểm mức độ nghiêm trọng.
Hình ảnh tối hơn trên dữ liệu thực tế, lộn xộn hơn. Trên WithdrarXiv-Check, một bộ gồm 211 bài báo arXiv đã được rút lại thực sự, MLR ghi được 26,07% đối với các kết quả "tương tự" và 16,11% đối với các kết quả phù hợp chính xác — và hệ thống vẫn dễ bị tấn công bằng cách tiêm dấu nhắc ẩn được đưa vào văn bản bản thảo. Nói cách khác, đọc những bài viết thật đã bị rút lại khó hơn nhiều so với việc nắm bắt những mâu thuẫn tổng hợp.
Ý nghĩa của việc đánh giá ngang hàng
Bài học rút ra thực tế nhất của nghiên cứu có thể kém hấp dẫn nhất: cả thiết kế hệ thống và lựa chọn mô hình đều chuyển động đáng kể trong việc phát hiện lỗi và những người đánh giá đọc trước khi đánh giá sẽ tìm thấy nhiều lỗi nghiêm trọng hơn so với những lỗi khớp với mẫu trên văn bản đánh giá của con người. Sự khác biệt đó rất quan trọng vì hầu hết công việc trước đây về đánh giá có sự hỗ trợ của AI đều được tối ưu hóa để phù hợp với các đánh giá của con người - một thước đo khen thưởng sự tuân thủ nghe có vẻ tự tin hơn là sự xem xét kỹ lưỡng thực sự.
Kết quả của Sakana không cho thấy AI đã sẵn sàng thay thế trọng tài con người - một hệ thống bỏ qua hầu hết các lỗi trên các giấy tờ đã được rút lại chính hãng và có thể bị thao túng bằng các lời nhắc nhúng được coi là tốt nhất như một lớp hỗ trợ chứ không phải một cơ quan có thẩm quyền. Các lỗi tổng hợp của điểm chuẩn cũng rõ ràng hơn so với những sự mơ hồ về mặt thống kê và những diễn giải gây tranh cãi chi phối sự bất đồng thực sự trong đánh giá ngang hàng, do đó, hiệu suất đối với những mâu thuẫn được tạo ra nên được coi là mức trần chứ không phải là một lời hứa.
Nhưng với mức giá khoảng 0,47 USD cho mỗi lần đánh giá, với tỷ lệ phát hiện lỗi cao nhất so với bất kỳ hệ thống nào được thử nghiệm, MLR hướng đến một thời gian ngắn mà người đánh giá AI xử lý màn hình vượt qua đầu tiên để phát hiện những mâu thuẫn trong khi người đánh giá con người tập trung vào các quyết định mà máy móc vẫn không thể thực hiện. Các tạp chí và nhà tổ chức hội nghị đang thử nghiệm đánh giá có sự hỗ trợ của LLM hiện có cả điểm chuẩn công khai và đường cơ sở mạnh mẽ để đo lường hệ thống của riêng họ — và nếu khoảng cách giữa 73,43% và 14,81% vẫn giữ nguyên thì đó là một tín hiệu rõ ràng rằng kiến trúc đọc quan trọng hơn kích thước mô hình thô.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →