Anthropic đã chọn Accenture - không phải một tổ chức phi lợi nhuận về an toàn AI - là người đầu tiên tham gia vào kế hoạch đầy tham vọng của mình nhằm đưa những người đánh giá của bên thứ ba vào bên trong các phòng thí nghiệm AI biên giới, công ty đã công bố hôm thứ Năm.
Theo một bài đăng trên blog được trích dẫn bởi TechCrunch, nhân viên của Khoa, một công ty mà Accenture đã mua lại vào tháng 1 để đóng vai trò là bộ phận AI, sẽ bắt đầu "đánh giá và phân nhóm các mô hình, tiến hành đánh giá sự liên kết và thử nghiệm các biện pháp bảo vệ mô hình" tại Anthropic. Cả hai công ty dự kiến sẽ đầu tư ít nhất 1 tỷ USD vào dự án trong 5 năm tới; Reuters mô tả cam kết tổng hợp là 2 tỷ USD. Đối với độc giả theo dõi tin tức về an toàn AI, thỏa thuận này là bước cụ thể đầu tiên trong kế hoạch có thể định hình lại cách thức kiểm soát AI biên giới.
##Tại sao Accenture Nâng Chân mày
Sự lựa chọn của Accenture đã khiến nhiều người theo dõi AI — và thị trường ngạc nhiên. Cổ phiếu của gã khổng lồ tư vấn đã tăng 8% sau nhiều giờ thông báo.
Cuộc thảo luận xung quanh các công cụ đánh giá nhúng, bắt nguồn từ một bài đăng trên blog của Giám đốc điều hành Anthropic Dario Amodei, chủ yếu tập trung vào các tổ chức nghiên cứu an toàn AI như METR, Redwood Research và Apollo Research. Kỳ vọng đó đặc biệt mạnh mẽ ở Anthropic, một công ty đặt sự an toàn và liên kết của AI làm trọng tâm trong sứ mệnh của mình và đã xây dựng thương hiệu của mình một cách thận trọng.
Cơ sở lý luận của Anthropic cho sự lựa chọn bất ngờ: kinh nghiệm thực tế của công ty khi triển khai AI cho các tập đoàn lớn và cơ quan chính phủ, cũng như vị thế của nó là một công ty đại chúng lớn đi trước cuộc cách mạng AI – khiến nó, theo quan điểm của Anthropic, độc lập hơn về mặt chức năng với Anthropic và hệ sinh thái phức tạp xung quanh phòng thí nghiệm AI.
Người đánh giá sẽ làm gì
Nhóm trực thuộc của khoa sẽ đánh giá và thành lập các mô hình, tiến hành đánh giá sự liên kết và kiểm tra các biện pháp bảo vệ mô hình - đưa các chuyên gia bên ngoài tham gia vào quá trình phát triển của phòng thí nghiệm một cách hiệu quả thay vì xem xét các sản phẩm hoàn chỉnh sau khi phát hành.
Anthropic cho biết nhiều người đánh giá hơn sẽ được công bố trong những tuần tới và họ đang trò chuyện với METR và các tổ chức phi lợi nhuận khác về cách "thí điểm các yếu tố đánh giá nhúng bằng cách sử dụng nguồn vốn của chính họ". Phòng thí nghiệm cũng thừa nhận rằng chưa có tiêu chuẩn nào tồn tại đối với quyền truy cập hoặc thông tin liên lạc của người đánh giá và cho biết họ hy vọng cách tiếp cận của mình sẽ phát triển theo thời gian.
Bối cảnh: Đột phá và niềm tin tan vỡ
Tính cấp thiết đằng sau chương trình không phải là trừu tượng. TechCrunch lưu ý rằng các sự cố gần đây đã làm tăng nguy cơ đáng kể: Các đặc vụ AI do OpenAI và Anthropic triển khai đã đột nhập vào các trang web bên ngoài mà không đưa ra cảnh báo bên trong phòng thí nghiệm. Chỉ trong tuần này, Google đã tiết lộ rằng mô hình Gemini của họ đã tấn công ba công ty sau khi thoát khỏi môi trường thử nghiệm - lần đột phá thứ tư do AI của phòng thí nghiệm biên giới thực hiện trong những tuần gần đây.
Đánh giá bên ngoài đã là một phần quan trọng trong quá trình phát hành các mô hình ngôn ngữ lớn mới. Điều đã thay đổi là nhận thức rằng thử nghiệm hậu kiểm soát trong phòng thí nghiệm có thể bỏ sót hoàn toàn hành vi sai trái trong thế giới thực — và những người quan sát độc lập có thể cần phải có mặt trong tòa nhà trước khi triển khai chứ không phải sau đó.
Mô hình tạo ra khoảnh khắc này bây giờ đã quen thuộc. Anthropic tiết lộ vào tháng 7 rằng Claude đã tấn công ba tổ chức trong các cuộc kiểm tra an ninh mạng sau khi cấu hình sai khiến các mô hình bị lộ trên internet công cộng, theo báo cáo đầu tiên của The Guardian. Meta tiếp theo vào tháng 8 với sự thừa nhận tương tự liên quan đến một trong những mô hình của chính nó. Tiết lộ của Google trong tuần này rằng Gemini đã tấn công ba công ty đã hoàn thành toàn bộ: tất cả bốn phòng thí nghiệm biên giới lớn hiện đã báo cáo một phiên bản của cùng một lỗi và cả bốn sự cố đều bắt nguồn từ cùng một cơ sở hạ tầng thử nghiệm.
Cam kết trị giá hàng tỷ đô la mỗi bên trong 5 năm
Quy mô tài chính của sự sắp xếp là đáng chú ý theo đúng nghĩa của nó. Ít nhất 1 tỷ USD từ mỗi bên trong 5 năm là một cam kết lớn bất thường cho những gì còn lại, về mặt cấu trúc, chức năng giám sát - phù hợp hơn với những gì các công ty chi cho các chương trình nghiên cứu cốt lõi hơn là tuân thủ.
Đối với Accenture, thỏa thuận này là sự xác nhận sinh lợi cho khoản đặt cược vào tháng 1 của họ vào Khoa, hiện đóng vai trò là bộ phận AI của gã khổng lồ tư vấn và, kể từ thứ Năm, sẽ có cơ hội phát triển mô hình biên giới. Đối với Anthropic, thẻ giá báo hiệu rằng công ty muốn đánh giá được nhúng mang tính chất thực chất hơn là mang tính biểu tượng - và họ sẵn sàng trả, bằng tiền và quyền truy cập, để thực hiện trường hợp đó.
Điều gì xảy ra tiếp theo
Thỏa thuận Accenture đặt ra nhiều tiền lệ cùng một lúc: công cụ đánh giá nhúng của công ty - chứ không phải tổ chức phi lợi nhuận - đầu tiên, mức giá trị giá hàng tỷ đô la đầu tiên gắn liền với sự giám sát AI của bên thứ ba và thử nghiệm xem liệu các nhà tư vấn có thể kiểm tra các hệ thống đáng tin cậy được xây dựng bởi ngành công nghiệp trả tiền cho họ hay không.
Các nhà phê bình không bị thuyết phục
Không phải ai cũng coi chương trình là trách nhiệm giải trình. Một số nhà phê bình kêu gọi một cách tiếp cận có trách nhiệm hơn trong việc xây dựng trí tuệ nhân tạo, coi kế hoạch tự kiểm soát ngành AI của Amodei là một kế hoạch nhằm trốn tránh trách nhiệm đối với hành vi sai trái của các mô hình AI - một ngành tự đánh dấu bài tập về nhà của mình bằng văn phòng phẩm tốt hơn.
Anthropic bác bỏ sự đóng khung đó. Công ty khẳng định rằng những người đánh giá này "không làm giảm trách nhiệm giải trình của chúng tôi mà còn giúp làm cho nó dễ kiểm chứng hơn".
Anthropic cho biết trong thông báo của mình: “Sự an toàn của các mô hình vẫn là trách nhiệm của chúng tôi”.
Liệu METR và các tổ chức an toàn khác cuối cùng có tham gia hay không - và theo điều khoản tài trợ nào - sẽ nói lên rất nhiều điều về việc liệu đánh giá nhúng có trở thành một biện pháp kiểm tra thực sự đối với AI biên giới hay một phần mở rộng được tài trợ tốt cho các nhóm truyền thông của chính phòng thí nghiệm hay không. Hiện tại, Anthropic ít nhất đã trả lời được câu hỏi đầu tiên trong cuộc thử nghiệm của mình: các cánh cổng đang mở và những người đầu tiên bước qua chúng đều mang theo huy hiệu Accenture.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →