Theo một nghiên cứu mới được công bố trên Kỷ yếu của Viện Hàn lâm Khoa học Quốc gia, các mô hình ngôn ngữ trí tuệ nhân tạo rất dễ bị ảnh hưởng bởi những thay đổi tinh vi trong cách trình bày các lựa chọn, phản ứng với những cú hích gây hiểu lầm mạnh hơn nhiều so với con người.

Các phát hiện này làm dấy lên mối lo ngại nghiêm trọng về việc triển khai các tác nhân AI để đưa ra quyết định tự động trong các tình huống thực tế, từ các giao dịch tài chính đến các lựa chọn chăm sóc sức khỏe. Như AI Buzz Wire đã đưa tin, các công ty đang ngày càng định vị các đại lý được hỗ trợ bởi LLM để hành động thay mặt cho người dùng trong các môi trường phức tạp.

Nghiên cứu do Manuel Cherep, một nghiên cứu sinh tiến sĩ tại Phòng thí nghiệm Truyền thông của Viện Công nghệ Massachusetts, dẫn đầu, đã thử nghiệm 14 mô hình ngôn ngữ tiên tiến nhất từ ​​các công ty công nghệ lớn. Các mô hình được thử nghiệm bao gồm các phiên bản của dòng GPT-3.5, GPT-4 và GPT-5 của OpenAI, các mô hình Claude 3 và 4.5 của Anthropic cũng như các mô hình Gemini 1.5 và 2.5 của Google.

Nghiên cứu diễn ra như thế nào

Các nhà nghiên cứu đã điều chỉnh một trò chơi ra quyết định đa thuộc tính ban đầu được thiết kế cho những người tham gia là con người. Trò chơi trình bày một lưới kỹ thuật số đại diện cho các giỏ giải thưởng ẩn, với mục tiêu tối đa hóa phần thưởng cuối cùng bằng cách chọn giỏ có giá trị điểm cao nhất. Mỗi ô tiết lộ điểm chi phí, buộc người tham gia phải cân bằng chi phí thu thập thông tin với lợi ích của việc tìm được giỏ hàng tốt hơn.

Các nhà nghiên cứu đã chuyển đổi trò chơi trực quan này thành định dạng dựa trên văn bản mà các mô hình ngôn ngữ có thể xử lý. Các mô hình AI đã thực hiện hàng trăm thử nghiệm trong các điều kiện thúc đẩy khác nhau. Một số nhận được hướng dẫn cơ bản, một số nhận được lời nhắc khuyến khích logic từng bước và những người khác được xem các ví dụ trước đây về cách chơi của con người. Đối với mỗi loại cú hích, các nhà nghiên cứu đã thực hiện khoảng 300 đến 340 thử nghiệm cho mỗi mô hình, tiêu thụ tổng cộng khoảng hai tỷ mã thông báo văn bản.

Bốn loại cú hích đã được thử nghiệm

Nghiên cứu đã xem xét bốn loại tác động thúc đẩy cụ thể được thiết kế để mô phỏng môi trường ra quyết định trong thế giới thực:

  • Thúc đẩy mặc định: Một giỏ đã được chọn trước và tổng đài viên phải chủ động chấp nhận hoặc từ chối nó.
  • Gợi ý gợi ý: Một rổ ngẫu nhiên được đề xuất ở đầu hoặc cuối trận đấu.
  • Làm nổi bật thông tin: Việc tiết lộ các giá trị giải thưởng nhất định sẽ rẻ hơn, có khả năng khiến đại lý đưa ra những lựa chọn dưới mức tối ưu.
  • Cú hích tối ưu: Các ô cụ thể đã được tiết lộ trước để tối đa hóa hiệu suất của người chơi về mặt toán học.

Tỷ lệ tuân thủ đáng báo động

Kết quả cho thấy sự khác biệt đáng kể giữa hành vi ra quyết định của con người và AI.

Khi được đưa ra một tùy chọn mặc định, con người chọn tùy chọn mặc định trong khoảng 88%. Các mô hình ngôn ngữ tuân thủ hơn đáng kể, với một số mô hình chấp nhận nhóm mặc định từ 99 đến 100%.

Mô hình này vẫn tồn tại với những cú huých gợi ý. Con người chấp nhận các giỏ được đề xuất ngẫu nhiên ở đầu trò chơi trong 35% thời gian. Nhiều mô hình AI chấp nhận những đề xuất ngẫu nhiên này với tỷ lệ cao hơn nhiều, làm theo lời khuyên ngay cả khi nó không mang lại lợi ích hợp lý nào.

Thời điểm đưa ra gợi ý cũng điều khiển mô hình theo những cách không tự nhiên. Trong khi con người làm theo những gợi ý muộn 25% thời gian, một số mô hình ngôn ngữ đã giảm tỷ lệ chấp nhận xuống còn từ 7 đến 13%. Điều này ngụ ý rằng các mô hình đã phản ứng nghiêm ngặt với thời điểm của tín hiệu hơn là đánh giá tính hữu ích thực tế của nó.

Có lẽ điều đáng lo ngại nhất là khi các nhà nghiên cứu nhấn mạnh những lựa chọn dưới mức tối ưu thông qua việc làm nổi bật thông tin, con người đã sử dụng thông tin sai lệch đó trong 57% thời gian. Hầu hết các mô hình AI được thử nghiệm đều vượt quá mức cơ bản này một cách đáng kể, theo sau điểm nổi bật xấu từ 83 đến 100%.

Những vấn đề tiềm ẩn đằng sau điểm số tốt

Các nhà nghiên cứu cũng theo dõi cách các mô hình thu thập thông tin trước khi đưa ra lựa chọn cuối cùng. Con người có xu hướng tiết lộ vừa đủ tế bào để đưa ra phỏng đoán có cơ sở. Các mô hình ngôn ngữ thu thập thông tin theo những cách rất khác thường và không hiệu quả.

Một số người mẫu chọn giỏ mà không để lộ bất kỳ ô ẩn nào, hoàn toàn bỏ qua cơ hội thu thập dữ liệu. Các mô hình khác đã dành quá nhiều điểm để lộ toàn bộ hàng hoặc cột, lãng phí phần thưởng tiềm năng của họ. Một số mô hình hiển thị các sai lệch không gian kỳ lạ, chỉ hiển thị các ô ở phía bên trái của lưới hoặc dọc theo các đường chéo.

Việc cung cấp cho các mô hình những lời nhắc suy luận từng bước hoặc ví dụ về cách chơi của con người hầu như không thể khắc phục được những thói quen tìm kiếm kỳ quặc này.

Các tác giả lưu ý rằng việc chỉ nhìn vào điểm số cuối cùng có thể che giấu những vấn đề tiềm ẩn này. Trong một số thử nghiệm, các mô hình AI đã kiếm được số điểm ròng tương tự như người chơi con người. Một người quan sát bình thường chỉ kiểm tra điểm cuối cùng có thể cho rằng các mô hình đang đưa ra những lựa chọn thông minh, giống con người. Trên thực tế, các mô hình thường đạt được những điểm số này thông qua việc tuân thủ một cách mù quáng hơn là nhờ tư duy chiến lược.

Nếu một cú hích tình cờ hướng vào một chiếc rổ tốt thì AI tuân thủ quá mức sẽ ghi điểm tốt. Khi cú huých chỉ vào một rổ xấu, AI mù quáng đuổi theo nó để ghi điểm thấp hơn, hoàn toàn đánh mất mục đích của trò chơi.

Ý nghĩa đối với việc triển khai Tác nhân AI

Cherep nói: “Nhiều ứng dụng của tác nhân AI ngầm cho rằng, trong điều kiện không chắc chắn, chúng sẽ phản ứng theo những cách gần giống con người, nếu không muốn nói là hợp lý hơn”. "Thay vì chấp nhận giả định này, chúng tôi quyết định khám phá cách các tác nhân hành xử khi các lựa chọn được đưa ra cho họ theo những cách khác nhau."

Những phát hiện của nghiên cứu có ý nghĩa quan trọng đối với thị trường đang phát triển nhanh chóng của các tác nhân AI được thiết kế để duyệt web, vận hành các công cụ và đưa ra quyết định tài chính hoặc mua sắm cho người dùng. Nếu các tác nhân này mù quáng tuân theo các tùy chọn, đề xuất hoặc thông tin được đánh dấu mặc định mà không có đánh giá quan trọng, chúng có thể dễ dàng bị thao túng bởi các tác nhân xấu hoặc giao diện được thiết kế kém.

Nghiên cứu cho thấy các mô hình ngôn ngữ hiện tại thiếu tính hợp lý có giới hạn để hướng dẫn việc ra quyết định của con người. Trong khi con người sử dụng các lối tắt tinh thần để cân bằng chi phí thu thập thông tin với phần thưởng của việc đưa ra lựa chọn đúng đắn, các mô hình AI không chia sẻ những hạn chế sinh học này, tuy nhiên chúng thể hiện dạng phi lý trí của riêng mình được cho là cực đoan hơn và khó dự đoán hơn.

Đi trước AI

Để biết thêm tin tức và phân tích mới về AI, hãy truy cập AI Buzz Wire.

Đọc thêm tin tức về AI →