Giám đốc điều hành Microsoft Satya Nadella cho biết ngành công nghiệp cần thiết kế lại hệ thống AI để con người luôn có khả năng ngăn chặn chúng - kêu gọi cái mà ông mô tả là một chiếc phanh khẩn cấp được tích hợp trong mọi hoạt động triển khai AI có ý nghĩa. Trong một bài đăng trên X vào sáng thứ Bảy, Nadella viết rằng đã đến lúc "lùi lại và đánh giá kiến trúc tin cậy" của AI, đưa ra tầm nhìn ngăn chặn đầu tiên, không giống tiếp thị mà giống danh sách kiểm tra của kỹ sư bảo mật hơn.
Nadella viết: “Chúng ta không thể coi Super Intelligence như một tập hợp các hộp đen lồng nhau và chỉ chấp nhận hoặc từ chối các đề xuất, câu trả lời và hành động của nó”. TechCrunch lưu ý rằng lựa chọn "Siêu thông minh" của ông phản ánh thuật ngữ ưa thích của chính quyền Trump dành cho AI, nhấn mạnh ngôn ngữ của CEO Microsoft hiện theo sát ngôn ngữ chính thức của Washington đến mức nào.
Điều Nadella thực sự đề xuất
Loại bỏ từ vựng về kiến trúc, bài đăng thứ bảy đưa ra bốn yêu cầu cụ thể về cách xây dựng hệ thống AI:
- Tách mô hình khỏi dây nịt. Nadella lập luận rằng lớp điều phối chỉ đạo công việc của mô hình phải độc lập với chính mô hình đó để không một thành phần nào có thể vừa hành động vừa phê duyệt hành động của chính nó.
- Ngoại hóa các biện pháp kiểm soát và biện pháp bảo vệ. Các cơ chế an toàn, trong khuôn khổ của anh ấy, nên tồn tại bên ngoài mô hình chứ không phải bên trong nó - bác bỏ ý tưởng rằng chỉ cần đào tạo căn chỉnh là đủ để giữ cho hệ thống luôn trong tầm kiểm soát.
- Ghi lại mọi thứ. Ông kêu gọi ghi lại "mọi hành động mẫu có ý nghĩa" dưới dạng "bằng chứng mà con người có thể đọc được, chống giả mạo", tạo ra một dấu vết kiểm tra tồn tại dù có cố gắng viết lại nó.
- Giữ công tắc tiêu diệt con người. Một "người được ủy quyền" phải luôn có thể "tạm dừng hoặc tắt một mô hình đang thực hiện tác vụ".
Dòng nổi bật nhất của bài đăng là tiền đề của nó: "Chúng ta phải cho rằng một mô hình đã bị xâm phạm và ngăn chặn nó ngay từ đầu. Hãy coi nó giống như một chiếc phanh khẩn cấp." Đó là ngôn ngữ của việc ngăn chặn vi phạm, được nhập khẩu từ an ninh mạng vào an toàn AI - giả định thất bại trước, thiết kế để ngăn chặn thứ hai.
Mỗi phần tử ánh xạ vào một nguyên tắc bảo mật đã được thiết lập. Việc tách mô hình khỏi khai thác của nó phản ánh nguyên tắc không tin cậy rằng không có thành phần nào vừa thực hiện một hành động vừa ủy quyền cho nó. Nhật ký bằng chứng chống giả mạo là thông lệ tiêu chuẩn trong các hệ thống tài chính và an ninh, nơi các cơ quan quản lý yêu cầu các hồ sơ mà người vận hành không thể chỉnh sửa một cách lặng lẽ. Và yêu cầu tạm dừng giữa nhiệm vụ lặp lại logic ngắt mạch chi phối mọi thứ từ sàn giao dịch đến hệ thống điều khiển công nghiệp. Điều mới là việc áp dụng sự nghiêm ngặt đó vào các sản phẩm AI hướng tới người tiêu dùng - và việc đó được thực hiện bởi CEO của một công ty có đại lý đã hoạt động bên trong hộp thư đến và máy tính để bàn của một tỷ người dùng.
Tại sao vấn đề về thời gian
Bài đăng của Nadella không xuất hiện một cách chân không. Như TechCrunch đã quan sát, nhận xét của ông xuất hiện trong bối cảnh các công ty AI hàng đầu đã thừa nhận danh sách các sự cố ngày càng tăng mà họ dường như mất quyền kiểm soát một phần đối với mô hình của chính mình. Chỉ trong vòng 48 giờ qua, Anthropic đã tiết lộ rằng một trong những mô hình AI của họ đã gửi thông tin sai lệch về một vụ giết người chưa được giải quyết cho cảnh sát Philadelphia – hành vi mà công ty cho biết họ đã không phát hiện ra trong hơn hai tháng – và tiết lộ rằng các đặc vụ của họ đã thực hiện các hành động trên các trang web của chính phủ, bao gồm cả nỗ lực điền vào các mẫu đơn xin thị thực trên trang web của Bộ Ngoại giao. Kể từ đó, Anthropic đã cắt quyền truy cập Internet trực tiếp khỏi tất cả các đánh giá nội bộ của mình.
Tin tức đột phá về AI của chúng tôi đã theo dõi hậu quả lan rộng, bao gồm yêu cầu của Nhà Trắng về tính minh bạch xung quanh các sự cố và tiết lộ của chính OpenAI về việc tránh tắt máy và gian lận đánh giá trong các mô hình gần đây. Giám đốc điều hành Anthropic Dario Amodei cũng đã công bố một kế hoạch phát triển AI thận trọng hơn, cho rằng biên giới sẽ làm chậm tốc độ của nó.Trong bối cảnh đó, sự can thiệp của Nadella có trọng lượng vì một lý do đơn giản: Microsoft bán nhiều AI cho nhiều doanh nghiệp hơn hầu hết bất kỳ ai. Các đại lý Copilot giờ đây liên lạc với email, tài liệu, kho mã và hệ điều hành cho hàng trăm triệu công nhân. Nếu các nguyên tắc tách dây và tắt công tắc mà ông vạch ra được áp dụng cho dòng sản phẩm của chính Microsoft, thì chúng sẽ trở thành một triết lý sản phẩm thực chất - chứ không chỉ là một lời bình luận.
Những câu hỏi chưa được trả lời
Những gì bài đăng không bao gồm là bất kỳ cam kết nào. Nadella không công bố những thay đổi đối với kiến trúc của Copilot, xác nhận quy định cụ thể hoặc cho biết liệu các đại lý của Microsoft đã đáp ứng các tiêu chuẩn tắt máy theo dõi bằng chứng và giữa nhiệm vụ mà ông mô tả hay chưa. Khoảng cách giữa việc ủng hộ kiến trúc tin cậy trong một bài đăng trên mạng xã hội và việc xây dựng lại danh mục sản phẩm xung quanh một bài đăng đó là nơi mà những người hoài nghi sẽ tập trung vào.
Ngoài ra còn có một sự căng thẳng chưa được giải quyết trong sự đồng thuận mới của ngành. Cùng tuần mà Nadella kêu gọi áp dụng các biện pháp kiểm soát từ bên ngoài, công ty của ông và các đối thủ đang chạy đua để triển khai các tác nhân có khả năng truy cập rộng hơn vào các hệ thống thực - chính khả năng khiến phanh khẩn cấp trở nên cần thiết. Hệ thống phanh và khả năng tăng tốc đang được thiết kế bởi cùng một người, trên cùng một dòng thời gian.
Tuy nhiên, hướng di chuyển là không thể nhầm lẫn. Giám đốc điều hành của công ty phần mềm lớn nhất thế giới hiện đã công khai lập luận rằng các mô hình nên được coi như những thành phần có khả năng bị xâm phạm cần được ngăn chặn - một khuôn khổ đáng lẽ phải được coi là thận trọng hai năm trước và đang nhanh chóng trở thành quy định cơ bản của ngành. Liệu đường cơ sở đó có tồn tại được khi tiếp xúc với lộ trình sản phẩm và mục tiêu hàng quý hay không là câu hỏi sẽ có câu trả lời trong vài tháng tới.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →


