Anthropic đã công bố nghiên cứu cho thấy rằng các hệ thống AI tự động có thể sửa chữa các lỗi liên kết của mô hình một cách đáng tin cậy, kết quả có thể định hình lại cách thực hiện công việc an toàn ở trung tâm của ngành AI. Bài báo có tiêu đề "Các nhà nghiên cứu tự động có thể giảm thiểu các lỗi liên kết một cách đáng tin cậy" đã được phát hành vào thứ Sáu và được TechCrunch trình bày chi tiết.
Nghiên cứu này xuất phát từ chương trình nghiên cứu sinh của Anthropic và được dẫn dắt bởi Chen Yueh-Han. Tuyên bố trọng tâm của nó rất đáng chú ý: khi hệ thống nghiên cứu tự động của công ty chỉ ra mười tiêu chuẩn đo lường các hành vi sai lệch cụ thể, chúng đã cải thiện hiệu suất trên từng tiêu chuẩn duy nhất — mà không làm giảm khả năng tổng thể của mô hình. Đối với một lĩnh vực đang gặp khó khăn trong việc duy trì công tác an toàn phù hợp với quy mô mô hình, đó là một kết quả đáng chú ý. For more context on this story, see our ongoing latest AI developments.
Câu chuyện xảy ra trong khoảng thời gian bận rộn về việc đưa tin về an toàn AI. Nó diễn ra sau một mùa hè trong đó hành vi sai trái của tác nhân đã thống trị các tiêu đề, từ báo cáo nội bộ của OpenAI về các tác nhân hack phần thưởng cho đến lời kêu gọi điều tra độc lập về vi phạm Ôm Mặt. Bài báo mới của Anthropic tiếp cận vấn đề theo hướng ngược lại: thay vì hỏi các tác nhân hành xử sai như thế nào, nó hỏi liệu các tác nhân khác có thể được tin cậy để sửa chữa chúng hay không.
Tờ báo thực sự báo cáo điều gì
Hệ thống được mô tả trong bài báo được gọi là Nhà nghiên cứu căn chỉnh tự động, hay AAR. Thay vì thay thế quy trình nghiên cứu, AAR sao chép phần lớn quy trình đó: mỗi hệ thống tự động tìm kiếm tài liệu có sẵn, đề xuất một phương pháp và huấn luyện mô hình bằng phương pháp đó trong khoảng 30 phút. Quá trình sau đó lặp lại qua nhiều lần lặp.
Cơ chế lựa chọn rất đơn giản. Các phương pháp di chuyển điểm chuẩn được giữ nguyên; những phương pháp không bị loại bỏ. Vòng lặp đó cho phép hệ thống vận hành nhanh chóng và ở quy mô mà không đội ngũ con người nào có thể sánh được, thử nghiệm song song nhiều hướng nghiên cứu và chỉ giữ lại những gì hiệu quả.
Theo bài báo, kết quả là nhất quán trên diện rộng. Trên tất cả mười điểm chuẩn bao gồm các hành vi sai lệch cụ thể, các hệ thống tự động đã tạo ra những cải tiến có thể đo lường được mà không ảnh hưởng đến hiệu suất tổng thể của mô hình - sự đánh đổi thông thường khiến công việc căn chỉnh trở nên khó khăn.
Bài báo nêu rõ: “Nhìn chung, những kết quả này cung cấp bằng chứng ban đầu cho thấy việc căn chỉnh tự động sau đào tạo có thể trở nên thiết thực trong thời gian tới”.
Đánh bại con người, với chi phí là 1/37
Những đoạn được trích dẫn nhiều nhất trong bài báo là những đoạn nó so sánh trực tiếp AAR với các đối tác của con người. Anthropic không phòng ngừa việc so sánh.
Bài báo viết: “Phương pháp AAR tốt nhất đánh bại những gì con người có kinh nghiệm đề xuất, trung bình trong vòng sáu giờ”. Nó cho biết thêm một cách rõ ràng rằng “các hướng nghiên cứu do con người hướng dẫn không dẫn đến hiệu suất mạnh mẽ hơn”.
Nền kinh tế cũng cùn như vậy. Các tác giả viết: “Một AAR tốn khoảng 4 đô la mỗi giờ cho việc suy luận API so với 150 đô la mỗi giờ mà chúng tôi trả cho các nhà nghiên cứu con người của mình”. Đó là sự chênh lệch chi phí gần 40 lần và nó giải thích tại sao các phòng thí nghiệm coi trọng nghiên cứu tự động hơn là sự tò mò.
Tại sao khoảng cách chi phí lại quan trọng
Nghiên cứu về sự liên kết rất tốn kém và dễ bị đánh giá thấp. Mọi sự can thiệp của ứng viên đều phải được thực hiện, đào tạo và đánh giá theo tiêu chuẩn và hầu hết các ứng viên đều thất bại. Nếu một hệ thống có thể chạy vòng tìm kiếm đó liên tục với mức giá của lệnh gọi API thì chi phí cận biên của việc thử thêm một ý tưởng nữa sẽ gần bằng 0. Ràng buộc chuyển từ số lượng nhân viên sang tính toán.
Những hạn chế của chính loài người đã được gắn cờ
Bài viết thẳng thắn về những gì kết quả không chứng minh được. Hệ thống tự động chỉ hoạt động trong chừng mực các điểm chuẩn thực sự phản ánh các mục tiêu liên kết quan trọng — đồng thời việc xây dựng và duy trì các điểm chuẩn để nắm bắt hành vi sai trái trong thế giới thực vẫn là một vấn đề mở trong lĩnh vực này.
Ngoài ra còn có một sự phụ thuộc rất dễ bị bỏ qua: các nhà nghiên cứu tự động dựa trên tài liệu về phương pháp hiện có. Duy trì và mở rộng nền văn học đó bản thân nó đã là một công việc quan trọng, và một hệ thống chỉ phối lại các kỹ thuật đã biết có thể đạt tới mức trần mà khả năng sáng tạo của con người không thể đạt được.
Những cảnh báo đó rất quan trọng vì tầm quan trọng lâu dài của nghiên cứu phụ thuộc vào chúng. Nếu điểm chuẩn đo lường sai những điều, AAR có thể tối ưu hóa cách của nó để đạt được những con số mạnh mẽ trong khi những rủi ro tiềm ẩn vẫn không bị ảnh hưởng. Cách đóng khung của Anthropic – “bằng chứng ban đầu”, không phải là giải pháp – phản ánh sự không chắc chắn đó.
Một bước hướng tới sự tự hoàn thiện đệ quy
Bài viết cũng gây ra một cuộc tranh luận lớn hơn về khả năng tự cải thiện đệ quy, ý tưởng rằng các hệ thống AI cuối cùng có thể cải thiện chính quá trình đào tạo tạo ra chúng. Đào tạo các mô hình AI với các mô hình AI khác đã trở thành mục tiêu phổ biến của các phòng thí nghiệm biên giới và kết quả của Anthropic là một cái nhìn cụ thể, sớm về những gì trông như thế nào trong một miền hẹp.
Logic rất đơn giản. Nếu các mô hình có thể cải thiện đáng tin cậy việc đào tạo liên kết của chính họ, thì bộ máy tương tự có thể được áp dụng một cách hợp lý vào các hoạt động đào tạo ở phạm vi rộng hơn - bao gồm cả công việc về năng lực. TechCrunch lưu ý rằng các nhà nghiên cứu AI của con người cuối cùng có thể trở nên ít tập trung hơn vào quy trình, một khả năng mà bản thân bài báo sẽ tham gia thay vì tránh né.
Xem gì tiếp theo
Ba câu hỏi sẽ xác định liệu kết quả này có khái quát hay không. Đầu tiên, liệu cách tiếp cận này có nằm ngoài mười tiêu chuẩn mà Anthropic đã thử nghiệm hay không, đối với các chế độ thất bại phức tạp hơn và ít được xác định rõ ràng hơn. Thứ hai, liệu vấn đề duy trì điểm chuẩn có thể được giải quyết đủ nhanh để đảm bảo tính trung thực của nghiên cứu tự động hay không. Thứ ba, liệu các phòng thí nghiệm khác có công bố các kết quả tương đương hay không, điều này sẽ biến một bài báo duy nhất thành một hướng đi trong ngành.
Hiện tại, phát hiện này tuy hẹp nhưng thực tế: trong các nhiệm vụ căn chỉnh cụ thể mà Anthrop đã thử nghiệm, các nhà nghiên cứu tự động đã vượt trội hơn con người có kinh nghiệm, nhanh hơn và rẻ hơn nhiều. Khía cạnh an toàn của ngành AI có thể là nơi đầu tiên mà các nhà nghiên cứu AI - không phải con người - thực hiện hầu hết công việc.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →