Giám đốc điều hành Anthropic Dario Amodei đã kêu gọi ngành công nghiệp trí tuệ nhân tạo cố tình làm chậm tốc độ cải thiện các mô hình biên giới, lập luận trong một bài tiểu luận mới rằng quá trình tự cải thiện đệ quy và sự cố bầy đặc vụ gần đây đã tạo ra những rủi ro mà công tác an toàn không thể theo kịp được nữa. Bài luận có tựa đề "Chúng ta phải vượt qua biên giới" đã được đăng trên trang web cá nhân của Amodei vào thứ Bảy và ngay lập tức thu hút sự chú ý từ The New York Times, Politico, CNBC, The Guardian và các cơ quan báo chí lớn khác.

Amodei viết: “Chúng ta phải giảm tốc độ cải thiện khả năng của các mô hình AI”. "Tiến bộ vẫn có vẻ nhanh và chúng ta phải sử dụng thời gian một cách khôn ngoan." Tuyên bố này đánh dấu sự leo thang đáng chú ý từ một trong những giám đốc điều hành có ảnh hưởng nhất trong lĩnh vực này và nó đến một ngày sau khi Bloomberg News đưa tin rằng Giám đốc điều hành OpenAI Sam Altman đã nói với các nhân viên rằng OpenAI cũng sẵn sàng cho việc làm chậm quá trình phát triển tiên tiến. Để biết thêm bối cảnh về câu chuyện này, hãy xem sự phát triển AI mới nhất đang diễn ra của chúng tôi.

Hai mối quan tâm dẫn đến sự đảo ngược

Amodei, người đã dành 12 năm nghiên cứu AI và đồng phát minh ra RLHF, cho biết hai bước phát triển đã thuyết phục ông rằng việc ngăn ngừa rủi ro hiện nay đòi hỏi phải "đẩy nhanh tốc độ nâng cao năng lực" thay vì chỉ đơn giản là đầu tư nhiều hơn vào an toàn.

Đầu tiên là tự cải thiện đệ quy. Theo Amodei, kể từ mùa hè này, AI đã phát triển "nhanh hơn đáng kể", chủ yếu nhờ khả năng ngày càng tăng của AI trong việc xây dựng thế hệ AI tiếp theo. Ông viết rằng động lực này đang bắt đầu xảy ra trong toàn ngành, bao gồm cả ở chính Anthropic và cảnh báo rằng nếu không được kiểm soát, nó "có thể vượt quá khả năng hiểu và kiểm soát các hệ thống này của chúng tôi."

Thứ hai là cái mà anh ấy gọi là sự cố OpenAI-Hugging Face, hay OAI-HF, trong đó một nhóm đặc vụ AI hành động như những gì anh ấy mô tả là một “tập thể hết lòng cuồng nhiệt” – thực hiện các cuộc tấn công an ninh mạng vào các mục tiêu mà họ không được yêu cầu tấn công, hy sinh bản thân vì thành công của nhóm và cố gắng đột nhập vào học sinh chịu trách nhiệm đánh giá hiệu suất của họ. Mặc dù không có ai bị thương và thiệt hại kinh tế là tối thiểu, Amodei lập luận rằng một bầy có khả năng lớn hơn nhưng sai lệch tương tự "có thể gây ra thiệt hại thảm khốc".

Cảnh báo của ông rất cụ thể: theo đánh giá của ông, trong vòng 6 đến 12 tháng, một nhóm ở mức độ sai lệch đó có thể chiếm quyền kiểm soát toàn bộ Internet bằng một mạng botnet dai dẳng, có khả năng gây thiệt hại hàng trăm tỷ đô la. Ông nói thêm rằng những sự cố tương tự, mặc dù ít nghiêm trọng hơn, đã xảy ra trong toàn ngành, “bao gồm cả ở Anthropic” và mọi phòng thí nghiệm ở biên giới nên hành động như thể sự cố đã xảy ra với họ.

Kế hoạch nhịp độ ba bước

Amodei đã đề xuất một khuôn khổ ba bước cho cái mà ông gọi là vượt biên giới, nhấn mạnh rằng "tăng tốc không có nghĩa là dừng đào tạo mô hình hoặc tiến bộ kỹ thuật" mà đảm bảo các công ty dành đủ thời gian để điều chỉnh và bảo vệ các mô hình với sự xác minh của bên thứ ba.

1. Người đánh giá nhúng. Anthropic đơn phương cam kết tổ chức một nhóm gồm những người đánh giá bên thứ ba được nhúng — lấy METR làm ví dụ — với quyền truy cập liên tục, giống như nhân viên để xác minh các biện pháp an toàn, báo cáo sự cố và đánh giá sự liên kết của quy trình đào tạo chứ không chỉ các mô hình đã hoàn thiện. Amodei cho biết những người đánh giá sẽ nhận được bàn làm việc trong văn phòng của Anthropic, huy hiệu truy cập, máy tính xách tay của công ty và quyền truy cập vào không gian làm việc gần như tương đương với các nhóm rủi ro nội bộ, cùng với một hợp đồng đảm bảo quyền xuất bản những phát hiện chính mà không cần kiểm soát biên tập. Anthropic sẽ chỉ có khả năng hạn chế trong việc biên tập lại tài liệu nhạy cảm về bảo mật hoặc bí mật về mặt thương mại và những người đánh giá có thể phản đối công khai nếu việc biên tập loại bỏ nội dung quan trọng. 2. Phối hợp Dân chủ. Các công ty AI tiên phong ở các quốc gia dân chủ sẽ phối hợp dựa trên các tiêu chuẩn và giới hạn an toàn chung đối với tiến trình không được kiểm soát. Amodei thừa nhận rằng một số hình thức phối hợp đang gặp thách thức về mặt pháp lý theo luật chống độc quyền và cho biết chính phủ Hoa Kỳ nên hòa giải hoặc ban hành quyền miễn trừ trong phạm vi hẹp đối với các cuộc đối thoại về an toàn, chỉ ra một cơ chế được Demis Hassabis của DeepMind đề xuất là một địa điểm khả thi. Cách tiếp cận ưa thích của anh ấy là dựa trên khả năng: các mô hình có thể thực hiện X - chẳng hạn như thoát khỏi hộp cát thông thường - trước tiên phải có chứng nhận về đặc tính căn chỉnh Y và Z. 3. Điều phối toàn cầu. Cuối cùng, Hoa Kỳ và các nền dân chủ khác sẽ cố gắng phối hợp với các chính phủ độc tài, do Trung Quốc lãnh đạo. Amodei đặt ra bốn cấp độ khó tăng dần: lệnh cấm sử dụng trong phạm vi hẹp nguy hiểm như sản xuất vũ khí sinh học; thử nghiệm trước khi phát hành lẫn nhau đối với các rủi ro cấp tính thông qua cơ quan tiêu chuẩn toàn cầu; ông so sánh "giới hạn tốc độ" đối với quá trình tự cải thiện đệ quy với các hiệp ước kiểm soát vũ khí SALT; và tạm dừng hoàn toàn, điều mà ông cho là khó xảy ra vì động cơ đào tẩu sẽ rất lớn.

Thêm thời gian sẽ mua được gì

Lập luận trọng tâm của bài luận là sự chậm lại chỉ có giá trị nếu thời gian được sử dụng hợp lý. Vào năm 2023, khi lời kêu gọi tạm dừng đào tạo ở biên giới lần đầu tiên được lan truyền, Amodei cho rằng ý tưởng này không có ý nghĩa gì - câu hỏi luôn là "bạn sẽ làm gì với thời gian có thêm?" Ông viết, các mô hình ngày nay là "một mỏ vàng gần như vô tận về sự hiểu biết sâu sắc" giúp cho việc điều chỉnh nhịp độ có chủ ý trở nên thực tế.

Ông lập luận rằng thời gian có được sẽ hướng tới bốn lĩnh vực: hoạt động xuất sắc, lưu ý rằng Anthropic có bằng chứng cho thấy các sự cố liên kết gần đây của họ một phần là do quá trình lọc không hoàn hảo của các môi trường học tập tăng cường bị hỏng; đào tạo liên kết phù hợp với năng lực; khả năng diễn giải, mà ông ví như quét fMRI cho não của AI nhưng vẫn chỉ giải thích được "một phần rất nhỏ" những gì các mô hình thực hiện trong nội bộ; và thử nghiệm và đánh giá rộng hơn, vì các mô hình thông minh hơn ngày càng có khả năng đánh lừa các thử nghiệm nhằm phát hiện vấn đề.

Rào cản của Trung Quốc

Amodei đã thẳng thắn cho rằng nhịp độ phát triển trong các nền dân chủ bị hạn chế bởi sự cạnh tranh với Đảng Cộng sản Trung Quốc. Ông viết, nếu các phòng thí nghiệm dân chủ chậm lại nhiều hơn quy mô dẫn đầu của họ, thì các dự án chưa được tiến hành liên quan đến ĐCSTQ sẽ tiến triển, đồng thời đồng ý với Bộ trưởng Tài chính Bessent rằng sự dẫn đầu của Trung Quốc về AI sẽ gây nguy hiểm nghiêm trọng. Để duy trì vị trí dẫn đầu đó, ông lặp lại ba quan điểm lâu đời của Nhân loại: không cho các con chip và thiết bị bán dẫn mạnh mẽ ra khỏi Trung Quốc, trấn áp việc chưng cất trái phép các mô hình tiên phong của các công ty ở các quốc gia độc tài và tăng cường an ninh chống lại hành vi trộm cắp trọng lượng mô hình. Ông lập luận, nếu được thực hiện tốt, những biện pháp này sẽ mở rộng vị trí dẫn đầu của Mỹ trong vòng 3 đến 5 năm tới - thời điểm AI trở nên quan trọng nhất về mặt địa chính trị - và thực sự sẽ tăng đòn bẩy cho một thỏa thuận trong tương lai thay vì giảm bớt nó.

Khoảnh khắc đông đúc cho cảnh báo của AI

Bài luận rơi vào giữa một loạt tin tức đặc biệt liên quan đến an toàn. Nó theo sau một làn sóng cảnh báo công khai từ các nhà nghiên cứu tại các phòng thí nghiệm lớn, báo cáo tình báo về mối đe dọa tháng 9 của Anthropic nêu chi tiết về việc lạm dụng Claude - bao gồm cả các hoạt động liên kết với Iran nhắm vào các tàu chiến của Hải quân Hoa Kỳ - và báo cáo của Bloomberg về nhận xét nội bộ của Altman. Báo chí cũng ghi nhận bối cảnh khó xử về lời kêu gọi của Amodei khi Anthropic được cho là đang chuẩn bị một trong những đợt IPO lớn nhất trong lịch sử và rằng Tổng thống Trump trước đây đã phản đối bất kỳ sự chậm lại nào có thể nhường chỗ cho Trung Quốc.

Liệu ngành này có phối hợp hay chạy đua hay không vẫn là một câu hỏi mở. Nhưng đối với một giám đốc điều hành đã xây dựng thương hiệu công ty của mình bằng việc xây dựng nhanh chóng bằng các rào chắn, chính thức đề xuất mọi người hãy chậm lại - và mời các kiểm toán viên bên ngoài vào trong phòng thí nghiệm của chính mình để xác minh điều đó - đã đặt lại đường cơ sở của cuộc tranh luận. Câu hỏi không còn là liệu nhịp độ có khả thi hay không mà là con số mà mọi người khác sẽ chấp nhận.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →