OpenAI đang bị đẩy lùi sau khi Claude Opus 5 của Anthropic thống trị điểm chuẩn ARC-AGI-3, công bố kết quả cho thấy mẫu GPT-5.6 Sol của chính nó đạt 38,3% - miễn là bạn sử dụng cài đặt ưa thích của OpenAI thay vì khai thác thử nghiệm chính thức.
Cuộc tranh chấp diễn ra vào ngày 30 tháng 7 năm 2026 đã giải quyết trọng tâm của một vấn đề đang gia tăng trong đánh giá AI: điểm chuẩn không còn chỉ đo lường một mô hình mà là toàn bộ khung kỹ thuật bao quanh nó. Để phân tích sâu hơn về những phát triển AI mới nhất và các bản phát hành mô hình, AI Buzz Wire đang theo dõi câu chuyện.
Những con số và cú bắt
OpenAI báo cáo rằng GPT-5.6 Sol đạt 38,3% trên ARC-AGI-3, vượt qua Claude Opus 5 của Anthropic, đạt 30,2% sau khi tăng gấp bốn lần kỷ lục của điểm chuẩn trước đó. Thông báo trước rất quan trọng: con số 38,3 phần trăm đó phụ thuộc vào hai tính năng cụ thể của API phản hồi của OpenAI.
Đầu tiên là Lý do được giữ lại, giúp duy trì chuỗi suy nghĩ của mô hình giữa các bước thay vì loại bỏ nó sau mỗi hành động. Thứ hai là Compaction, tóm tắt bối cảnh cũ hơn thay vì cắt bớt nó, cho phép mô hình tiếp tục xử lý các vấn đề dài mà không làm mất lý do trước đó.
Chạy qua khai thác được tiêu chuẩn hóa chính thức của ARC Prize — cố tình tránh các cài đặt dành riêng cho nhà cung cấp để đảm bảo so sánh giữa các táo - GPT-5.6 Sol chỉ quản lý được 7,8%. OpenAI lập luận rằng lý do là do thiết lập chính thức loại bỏ lý do của mô hình sau mỗi bước, làm giảm hiệu suất đối với các nhiệm vụ đòi hỏi tư duy nhiều bước liên tục.
Một chuẩn mực được xây dựng cho sự thuần khiết
ARC-AGI-3 được thiết kế bởi François Chollet và nhóm Giải thưởng ARC để thăm dò khả năng của một mô hình trong việc giải các câu đố lý luận mới lạ mà nó chưa từng thấy trước đây — một bài kiểm tra về trí thông minh tổng quát hơn là kiến thức đã ghi nhớ. Để giữ cho các so sánh được công bằng, bộ khai thác chính thức đã cố tình loại bỏ các tính năng dành riêng cho nhà cung cấp, đo lường khả năng của mô hình thô trong môi trường trung lập.
Lập luận phản bác của OpenAI là tính trung lập này có thể trở thành một điểm bất lợi. Công ty cho rằng việc khai thác chính thức dựa trên "API hoàn thiện kiểu OpenAI" cũ hơn, thiếu các khả năng mà API Claude đã cung cấp, khiến OpenAI gặp bất lợi về cấu trúc so với Anthropic trong so sánh ban đầu.
Về bản chất, OpenAI đang nói: bạn đo mô hình của chúng tôi bằng một tay bị trói sau lưng.
Phản hồi của Chollet
Người đồng sáng lập Giải thưởng ARC François Chollet đã phản hồi bằng cách vạch ra ranh giới rõ ràng giữa hai loại thiết lập thử nghiệm. Ông nói: “Việc khai thác “được tùy chỉnh để giải quyết điểm chuẩn hoặc chứa kiến thức về định dạng điểm chuẩn” là vượt quá giới hạn. Nhưng cài đặt API cho mục đích chung "không được phát triển cho ARC-AGI-3 và có sẵn cho tất cả người dùng API" là trò chơi công bằng.
Trên thực tế, Chollet thừa nhận rằng điểm GPT-5.6 Sol của ARC Prize đã đặt OpenAI vào thế bất lợi. Ông lưu ý rằng tổ chức này đã có “rất nhiều trao đổi qua lại với OpenAI về cách thử nghiệm tốt nhất các mô hình của họ, đặc biệt là liên quan đến việc nén” và hoan nghênh công ty “bắt đầu tìm ra câu trả lời”.
Chollet đã đánh dấu một mối lo ngại còn lại. Các nhà cung cấp khác nhau sử dụng các cài đặt khác nhau tạo ra cái mà ông gọi là "vấn đề tương đương tiềm ẩn" - nhưng ông cho rằng điều đó có thể chấp nhận được "miễn là các cài đặt và chi phí được báo cáo rõ ràng."
Tại sao điều này lại quan trọng ngoài bảng xếp hạng
Tập phim nhấn mạnh sự căng thẳng đang định hình lại cách ngành công nghiệp AI đánh giá sự tiến bộ. Khi các mô hình ngày càng được triển khai thông qua các API giàu tính năng thay vì các hệ thống độc lập, ranh giới giữa khả năng vốn có của mô hình và kỹ thuật xung quanh nó ngày càng mờ nhạt. Một tiêu chuẩn bỏ qua giàn giáo có thể đánh giá thấp hiệu suất trong thế giới thực; một công ty chấp nhận nó có thể thưởng cho các công ty đã thực hiện thử nghiệm.
Cuộc tranh luận về ARC-AGI-3 khó có thể là cuộc tranh luận cuối cùng. Khi các mô hình biên giới tụ lại gần đỉnh của các tiêu chuẩn đã được thiết lập, những bất đồng về những gì được coi là thước đo công bằng - và dây nịt của ai sẽ đặt ra tiêu chuẩn - sẽ chỉ ngày càng gia tăng.
Đi trước AI
Bạn muốn theo dõi tin tức mới nhất về AI về các mô hình, điểm chuẩn và phòng thí nghiệm xây dựng chúng? AI Buzz Wire sẽ hỗ trợ bạn.
Đọc thêm tin tức về AI