Công ty đo điểm chuẩn Phân tích nhân tạo đã phát hành phiên bản 4.2 của Chỉ số thông minh vào ngày 4 tháng 9 năm 2026, một bản cập nhật tạm thời làm lại cách đo lường các mô hình AI biên giới — và, theo bảng xếp hạng mới, Claude Fable 5.1 của Anthropic giữ vị trí hàng đầu, với GPT-6 Astra của OpenAI ở vị trí thứ hai sau khi tăng bốn điểm so với GPT-5.6 Sol.

Bản cập nhật xuất hiện chỉ tám tháng sau khi Index v4 ra mắt vào tháng 1, một sự thay đổi nhanh chóng bất thường mà công ty cho rằng là do tốc độ của các bản phát hành gần đây. Công ty viết trong thông báo: “Với việc biên giới thay đổi quá nhanh trong những tuần qua, chúng tôi cảm thấy điều quan trọng là phải cung cấp bản cập nhật tạm thời ngay lập tức để đảm bảo Chỉ số của chúng tôi vẫn phù hợp và hữu ích hơn bao giờ hết”.

Bảng xếp hạng tiêu đề

Theo kết quả được công bố, Claude Fable 5.1 của Anthropic dẫn đầu Chỉ số, tiếp theo là GPT-6 Astra của OpenAI, cải thiện bốn điểm so với GPT-5.6 Sol. Meta được xếp hạng là phòng thí nghiệm mạnh thứ ba trên bảng xếp hạng, tiếp theo là SpaceXAI, Moonshot/Kimi, Z.AI và Google.

Anthropic và OpenAI cũng chia sẻ bức tranh cập nhật về hiệu quả chi phí: hai công ty, cùng với Meta và Z.AI, chiếm giữ biên giới Pareto "Chi phí cho mỗi nhiệm vụ" của Chỉ số, nghĩa là hiện tại không có phòng thí nghiệm nào khác cung cấp thông tin tốt hơn hoàn toàn với cùng mức giá cho mỗi nhiệm vụ đã hoàn thành.

Về hiệu quả của mã thông báo, Phân tích nhân tạo nhận thấy GPT-6 Astra "hiệu quả về mã thông báo hơn hầu hết mọi mô hình khác gần biên giới thông minh", với Claude Fable 5.1, Grok 4.5 và Gemini 3.5 Flash-Lite nằm ở hai đầu của đường cong. Tuy nhiên, công ty đã lưu ý trong một phân tích đồng hành rằng mức sử dụng mã thông báo thấp hơn của Astra sẽ bị ảnh hưởng bởi mức giá cao hơn – một lời nhắc nhở rằng hiệu quả thô và tổng chi phí không phải lúc nào cũng đi cùng nhau.

Điều gì đã thay đổi trong phiên bản 4.2

Sự thay đổi cấu trúc quan trọng nhất là sự cố ý chống lại trò chơi chuẩn. Bốn mươi phần trăm trọng số của Chỉ số hiện đến từ các bộ thử nghiệm riêng tư được tổ chức sẵn — gấp đôi tỷ lệ trong phiên bản 4.1 — bao gồm AA-Briefcase, AA-Omniscience và các giải pháp cho CritPt. Công ty cho biết con số đó sẽ còn tăng thêm trong Index v5.

Hai đánh giá mới neo bản cập nhật:

  • AA-Briefcase, một chuẩn mực công việc kiến thức nội bộ dành cho nhân viên với bộ bài kiểm tra được tổ chức riêng. Các mô hình được đánh giá trong các dự án chuyên môn kéo dài nhiều tuần, mỗi dự án có nhiều nhiệm vụ được liên kết và hàng nghìn tệp nguồn đầu vào, đồng thời được phân loại thông qua sự kết hợp giữa chấm điểm theo tiêu chí đánh giá và so sánh theo cặp bao gồm thành công của nhiệm vụ có thể kiểm chứng, chất lượng phân tích và chất lượng trình bày.
  • GDP.pdf, do Surge AI tạo ra, kiểm tra khả năng suy luận một lượt trên các tài liệu chuyên nghiệp: 100 tệp PDF trải rộng trên 10 miền, với bằng chứng được phân bổ trên 4.592 trang văn bản, bảng, biểu đồ và chú thích cuối trang. Các câu trả lời được xếp loại theo 1.275 tiêu chí nguyên tử do chuyên gia soạn thảo và tiêu đề Tỷ lệ vượt qua chỉ ghi nhận một nhiệm vụ khi mọi tiêu chí đều được đáp ứng.

Một tiêu chuẩn lâu đời sắp bị loại bỏ: GPQA Diamond, bài kiểm tra lý luận khoa học cấp độ sau đại học, đã bị xóa vì nó đã bị bão hòa bởi các mô hình tiên phong.

Công ty cũng đã nâng cấp cơ sở hạ tầng chấm điểm của mình, phát hành AA-LCR v1.1 với lời nhắc hệ thống chấm điểm mới và các khóa trả lời đã sửa, neo lại thang đo Elo cho GDPval-AA v2 và AA-Briefcase để xếp hạng luôn ổn định khi có mẫu mới xuất hiện, đồng thời tăng cường hộp cát chấm điểm của SciCode để mã chậm nhưng chính xác không còn bị coi là lỗi nữa.

Bài kiểm tra mới tiết lộ điều gì

Kết quả của các đánh giá mới đưa ra một bức tranh chi tiết hơn về vị trí thực sự của các phòng thí nghiệm tiên phong.

Trên AA-Briefcase, Claude Fable 5.1 và Opus 5 của Anthropic dẫn đầu, tiếp theo là GPT-6 Astra của OpenAI và Muse Spark 1.3 của Meta. GPT-6 Astra đạt khoảng 85 điểm Elo cao hơn GPT-5.6 Sol trong cùng một đánh giá — một bước nhảy vọt đáng kể giữa các thế hệ OpenAI kế tiếp.

Trên GDP.pdf, tình hình lật ngược: OpenAI dẫn đầu với GPT-6 Astra với Tỷ lệ vượt qua 33,2%, tiếp theo là GPT-5.6 Sol ở mức 28,2% và Claude Fable 5,1 ở mức 26,2%. Sự khác biệt cho thấy việc tổng hợp tài liệu dài trên các bối cảnh rất lớn vẫn là một thế mạnh tương đối cho mô hình mới nhất của OpenAI, ngay cả khi các mô hình của Anthropic dẫn đầu các nhiệm vụ công việc tác nhân và Chỉ mục tổng thể.

Tại sao bộ bài kiểm tra riêng lại quan trọng

Sự thay đổi theo hướng đánh giá lâu dài phản ánh vấn đề về độ tin cậy rộng hơn trong việc đo điểm chuẩn của AI. Khi các mô hình tiếp thu nhiều dữ liệu kiểm tra công khai hơn, các phòng thí nghiệm và các nhà quan sát độc lập ngày càng lo ngại rằng điểm số chính trên các tiêu chuẩn nổi tiếng phản ánh khả năng ghi nhớ hoặc đào tạo có mục tiêu hơn là năng lực thực sự. Bằng cách giữ tỷ lệ ngày càng tăng của các bộ thử nghiệm ở chế độ riêng tư và đánh giá chúng cao hơn, Phân tích nhân tạo đang cố gắng duy trì tín hiệu rằng bảng xếp hạng công khai đang thua.

Công ty cho biết họ đã xây dựng các yếu tố của Index v5 "trong nhiều tháng" và cố tình giữ lại các bản cập nhật để giữ cho Chỉ số ổn định trước làn sóng ra mắt các mẫu máy lớn gần đây. Ngoài bản phát hành v4.2 tạm thời, nó còn có kế hoạch cập nhật nhiều hơn trong tương lai gần khi hoàn tất quá trình chuyển đổi v5.

Đối với những người mua lựa chọn giữa các mô hình tiên tiến, điểm rút ra thực tế từ v4.2 là vị trí dẫn đầu thị trường vẫn là cuộc đua song mã giữa Anthropic và OpenAI, với Meta thu hẹp khoảng cách — và các đánh giá được thiết kế để chống lại việc chơi game hiện đang thực hiện nhiều công việc xếp hạng hơn. Người dùng theo dõi các quyết định lựa chọn mô hình có thể theo dõi những phát triển AI mới nhất khi quá trình triển khai v5 đến gần.

Đi trước AI

Những cập nhật về điểm chuẩn như thế này sẽ định hình lại cách thức đánh giá của ngành tiến bộ. Đọc thêm tin tức về AI và luôn cập nhật mọi mẫu máy được phát hành.

Đọc thêm tin tức về AI →