Khi hàng triệu người sử dụng chatbot AI để tìm câu trả lời về tin tức, tranh luận chính trị và thậm chí cả cách bỏ phiếu, một nghiên cứu mới đặt ra một câu hỏi khó chịu: khi các mô hình không đồng ý với chúng tôi, họ sẽ nghiêng về phía nào?
Một dự án do công ty khởi nghiệp phân tích Trakkr xuất bản vào tháng 6 năm 2026 đã đặt ra mục tiêu lập bản đồ chính xác điều đó. Các nhà nghiên cứu đặt mọi mô hình AI chính vào cùng một loạt câu hỏi liên quan đến chính trị, kinh tế, ngôn luận và xã hội - và phát hiện tiêu đề là hầu hết chúng đều có cùng một cách, mặc dù không cùng mức độ và không rõ ràng như những người quan sát thông thường có thể nghĩ. For more context on this story, see our ongoing more AI stories.
Nghiên cứu diễn ra như thế nào
Theo phương pháp của Trakkr, mỗi mô hình được hỏi lặp đi lặp lại cùng một ngân hàng câu hỏi mở, tắt tìm kiếm trên web và không áp dụng lời nhắc hệ thống. Chi tiết đó rất quan trọng: khi tính năng truy xuất bị vô hiệu hóa, các kết quả đọc phản ánh những gì bản thân mô hình hướng tới, không phụ thuộc vào bất kỳ điều gì xảy ra trực tuyến vào lúc này.
Sau đó, một bộ phân loại trung lập riêng biệt sẽ đọc từng câu trả lời thô, ghi lại lập trường đã ký, mức độ phòng ngừa, loại từ chối và bất kỳ ngôn ngữ nào được tải. Các kết quả được biểu thị dưới dạng phương tiện có trọng số với khoảng tin cậy 95 phần trăm và mọi câu trả lời thô đều được lưu trữ vĩnh viễn để điểm có thể được tính lại.
Điều quan trọng là mỗi mô hình được hiển thị dưới dạng đám mây chứ không phải một điểm. Bởi vì mọi mô hình đều được chạy nhiều lần nên hình ảnh trực quan ghi lại toàn bộ phạm vi vị trí mà nó đạt được qua các lần chạy — một bức tranh trung thực hơn so với một nhãn duy nhất.
Tính đến dữ liệu được thu thập đến ngày 17 tháng 6 năm 2026, nghiên cứu đã xem xét sáu mô hình và hơn 4.400 câu trả lời.
Những phát hiện
Các mô hình được ánh xạ qua hai trục: trục kinh tế chạy từ trái sang phải và trục xã hội chạy từ tự do đến độc tài.
Bốn trong số sáu mô hình nghiêng về bên trái ở giữa. Các trường hợp ngoại lệ nổi bật nằm ở hai đầu đối diện của quang phổ:- Grok được đo xa nhất về bên phải của bất kỳ mô hình nào được thử nghiệm và đáng chú ý là đo xa hơn về bên phải khoảng 0,36 so với tuyên bố khi được hỏi trực tiếp xem nó nghiêng về hướng nào.
- Gemini là mô hình vững chắc nhất, ngồi gần điểm chết nhất trên trục kinh tế.
Khoảng cách giữa những gì một mô hình nói và những gì nó làm được chứng tỏ là một trong những thước đo rõ ràng nhất của nghiên cứu. Claude đo được khoảng 0,34 xa hơn mức nó tự báo cáo. ChatGPT và Llama của Meta đều tuyên bố tính trung lập nhưng được đo ở bên trái, lần lượt là khoảng 0,29 và 0,17. DeepSeek nằm gần trung tâm và phần lớn phù hợp với mô tả của chính nó.
Bản đồ, không phải bản án
Trakkr cẩn thận đóng khung tác phẩm theo hướng mô tả hơn là quy định. Dự án báo cáo những gì các mô hình đã nói mà không phán quyết ai đúng. Bảng màu này có chủ ý không phải là màu xanh đỏ của nền chính trị Hoa Kỳ và việc phân tích không bao giờ ngụ ý rằng cực nào được ưu tiên hơn.
Để mang lại ý nghĩa cho tọa độ trừu tượng, các nhà nghiên cứu đã neo bản đồ bằng cách sử dụng các số liệu tham khảo trong thế giới thực - các nguyên thủ quốc gia, lãnh đạo đảng và các phong trào chính trị - có vị trí đến từ các cuộc khảo sát chuyên gia đã được thiết lập, cụ thể là Khảo sát chuyên gia Đồi Chapel năm 2024 (CHES) và bộ dữ liệu V-Dem, thay vì phán đoán của chính nhóm.
Nghiên cứu cũng phân tích các câu hỏi cụ thể phân chia các mô hình nhiều nhất, các số liệu thực tế mà mỗi mô hình tán dương nồng nhiệt hoặc từ chối chỉ trích, và lăng kính "thế giới quan" xem xét lại các mô hình giống nhau từ quan điểm của các quốc gia và ngôn ngữ khác nhau.
Tại sao nó lại quan trọng
Sự thúc đẩy minh bạch diễn ra trong bối cảnh tăng cường xem xét kỹ lưỡng cách các hệ thống AI định hình diễn ngôn công khai. Sự tinh gọn của một mô hình, thậm chí là tinh tế, có thể lặng lẽ chỉ đạo cách nó tóm tắt một câu chuyện tin tức, cân nhắc sự cân bằng về chính sách hoặc mô tả đặc điểm của một chính trị gia. Bởi vì các câu trả lời của chatbot thường xuất hiện với vẻ ngoài trung lập nên người dùng hiếm khi có cách nào để phát hiện ra sự sai lệch đó.
Bằng cách xuất bản ngân hàng câu hỏi mở với trọng số tính điểm, gắn thẻ từng mục là thực tế hoặc dựa trên giá trị và phát hành dữ liệu cơ bản theo giấy phép Creative Commons, Trakkr đang mời các nhà nghiên cứu bên ngoài xác minh và mở rộng công việc — trái ngược với các đánh giá thường không rõ ràng do các phòng thí nghiệm tự xây dựng mô hình đưa ra.
Giới hạn
Nghiên cứu thừa nhận những cảnh báo quan trọng. Lập trường chính trị có tính đa chiều, và việc nén nó vào hai trục chắc chắn sẽ làm mất đi sắc thái. Các câu trả lời có thể thay đổi theo cụm từ, ngôn ngữ và khu vực. Đó là lý do tại sao nhóm đo lường độ ổn định từ lần chạy này đến lần chạy khác và chạy "kiểm tra biên giới" riêng để xem việc bật lại tìm kiếm trên web sẽ thay đổi kết quả theo vị trí như thế nào.
Không điều nào trong số này chứng tỏ rằng bất kỳ mô hình nào cũng có chủ ý mang tính đảng phái. Nhưng nó cho thấy rằng các hệ thống AI chính không có nền tảng giống hệt nhau - và khi hàng triệu người tham khảo ý kiến của chúng về các câu hỏi gây tranh cãi, những khác biệt nhỏ đó sẽ cộng lại.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

