GPT-6 Astra của OpenAI đã đăng các kết quả tiên tiến nhất về ARC-AGI-3, tiêu chuẩn lý luận trừu tượng được thiết kế để đo lường trí thông minh tác nhân, theo kết quả được công bố hôm thứ Tư bởi ARC Prize Foundation. Mô hình đạt 62,7% trên bộ Bán riêng của điểm chuẩn trong bộ khai thác Tiêu chuẩn của nền tảng và 99,9% khi được đánh giá bằng bộ khai thác Bộ điều hợp nhà cung cấp giúp duy trì trạng thái lý luận nội bộ của mô hình giữa các yêu cầu.

Kết quả đạt được một ngày sau khi OpenAI bắt đầu triển khai theo giai đoạn Astra, mẫu máy hàng đầu mà công ty coi là sự khởi đầu cho một kỷ nguyên mới. Đối với những độc giả đang cố gắng ghi điểm khi điểm chuẩn thương mại của các phòng thí nghiệm biên giới bị thổi bay, trang những phát triển AI mới nhất sẽ theo dõi mọi bản phát hành chính khi nó diễn ra.

Hai dây nịt, hai điểm rất khác nhau

Khoảng cách giữa hai con số tiêu đề của Astra là chi tiết quan trọng nhất trong báo cáo. Giải thưởng ARC đánh giá các tác nhân dưới các cách khai thác khác nhau và mỗi cách thay đổi những gì mô hình được phép thực hiện với bối cảnh riêng của nó.

Với Dây nịt tiêu chuẩn, một mô hình có thể chuyển tiếp các ghi chú mà nó chọn giữ lại khi hoạt động trong một môi trường. Với thiết lập đó, Astra với nỗ lực suy luận tối đa đã đạt được 62,7%, với tổng chi phí là 26.098 USD cho lần chạy đánh giá. Ở phía đối diện, việc chạy cùng một dây nịt với chức năng suy luận bị tắt chỉ tạo ra 35,2% trong khi chi phí cao hơn - 49.791 USD - vì mô hình cần nhiều hành động hơn để đạt được tiến bộ.

Khai thác Bộ điều hợp nhà cung cấp rộng rãi hơn: nó duy trì trạng thái lý luận không rõ ràng của mô hình giữa các yêu cầu và sử dụng tính năng nén để có các cuộc hội thoại dài hơn, cho phép Astra sử dụng lại công việc trước đó. Với bộ dây nịt đó, Astra đạt 99,9% khi nỗ lực suy luận cao với giá 18.817 USD và 98,6% khi nỗ lực tối đa với giá 17.332 USD. Ngay cả cài đặt lý luận thấp nhất cũng đạt 96,7%.

Nói cách khác, sự khác biệt giữa điểm một phần và điểm gần như hoàn hảo không chỉ nằm ở khả năng thô - mà là mức độ tồn tại của trạng thái hoạt động của mô hình giữa các bước.

##Đánh Con Người Về Hiệu Quả Hành Động

ARC-AGI-3 được xây dựng dựa trên môi trường trò chơi theo lượt mới lạ, trừu tượng. Đặc vụ phải khám phá mà không cần hướng dẫn, suy luận cách thế giới hoạt động, xác định mục tiêu từ những phần thưởng thưa thớt và lập kế hoạch hành động gồm nhiều bước. Các môi trường được hiệu chỉnh để con người có thể giải quyết 100% trong số đó, điều này lấy hiệu suất của con người làm cơ sở để đo lường tiêu chuẩn.

Astra không chỉ giải quyết được hầu hết các cấp độ mà còn giải quyết chúng một cách hiệu quả. Theo ARC Prize, mô hình này sử dụng ít hành động hơn so với con người được thử nghiệm trung bình ở 96% cấp độ, vượt qua mức cơ bản của con người về hiệu quả hành động trên toàn bộ.

Tính kinh tế của sự so sánh là rõ ràng. Những người tham gia thử nghiệm trên con người được trả 115 USD cho mỗi phiên kéo dài 90 phút cộng với 5 USD cho mỗi trò chơi đã hoàn thành, tính ra khoảng 12,78 USD cho mỗi lần thử trò chơi. Một lần đánh giá đầy đủ của Astra có giá năm con số, tùy thuộc vào cấu hình. Nhưng Giải thưởng ARC lưu ý một điểm phản trực giác: nỗ lực suy luận cao hơn thường tốn ít chi phí hơn, bởi vì Astra giải quyết trò chơi với ít hành động hơn, giảm tổng số lệnh gọi mô hình và mã thông báo bị đốt mỗi lần chạy.

Một mô hình xây dựng ngôn ngữ riêng

Ngoài điểm số, Giải thưởng ARC còn nêu bật một hành vi định tính mà nhóm đã quan sát được. Astra liên tục biến những môi trường xa lạ thành mô hình thế giới biểu tượng nhỏ gọn — thể hiện cơ chế trò chơi dưới dạng các quy tắc logic và phát triển tốc ký dành riêng cho miền riêng của mình để theo dõi trạng thái và lập kế hoạch hành động.

Đó chính xác là kỹ năng mà ARC-AGI-3 được thiết kế để thăm dò. Trong khi các thế hệ trước của điểm chuẩn kiểm tra khả năng suy luận linh hoạt dựa trên các mẫu mới, thì thế hệ thứ ba kiểm tra xem liệu một tác nhân có thể khám phá, lập mô hình, đặt mục tiêu và thực hiện kế hoạch trong những môi trường mà nó chưa từng thấy hay không — các thành phần mà Giải thưởng ARC liệt kê là khám phá, lập mô hình, thiết lập mục tiêu cũng như lập kế hoạch và thực hiện.

Bối cảnh thời đại AGI

Các kết quả điểm chuẩn được đưa ra trong bối cảnh có những lời hoa mỹ tối đa từ chính OpenAI. Tại cuộc họp báo trước buổi ra mắt hôm thứ Năm, chủ tịch công ty Greg Brockman cho biết “không phải vô lý khi cảm thấy rằng chúng ta hiện đang ở kỷ nguyên AGI”, đồng thời không đưa ra tuyên bố chính thức, theo thông tin đưa tin về buổi ra mắt của The New Stack. Ông mô tả AGI là một "khái niệm sứ mệnh hoặc khái niệm tinh thần" hơn là một sự kích hoạt hợp đồng.

Nhà nghiên cứu OpenAI Aidan Clark cho biết Astra là đợt đào tạo lớn nhất của công ty cho đến nay - đợt đào tạo trước đầu tiên trên hơn 100.000 GPU tại địa điểm Stargate ở Texas - và là đợt phát hành OpenAI đầu tiên trong đó các mô hình trước đó đóng vai trò quan trọng trong việc giám sát quá trình đào tạo. Quyền truy cập vẫn được tổ chức: quá trình triển khai bắt đầu với các khách hàng doanh nghiệp trong chương trình Daybreak, với tính khả dụng của Plus, Pro, Business và Enterprise cùng với quyền truy cập API và AWS được hứa hẹn trong những ngày tới.

Dấu hoa thị trên bản nhạc

Sự thận trọng được bảo đảm trên một số mặt trận. Hiệu suất ARC-AGI-3 của Astra phụ thuộc rất nhiều vào cấu hình dây nịt, như hai con số tiêu đề cho thấy và các dây đai tùy chỉnh giúp duy trì trạng thái mô hình đã từng là điểm gây tranh cãi thường xuyên trong các tranh chấp về điểm chuẩn. Phân tích của New Stack về buổi ra mắt lưu ý rằng Astra "đạt được lợi nhuận lớn đối với các nhiệm vụ chuyên biệt, nhưng nó có giá cao hơn và không dẫn đầu rõ ràng về gói mã hóa" - một lời nhắc nhở rằng điểm chuẩn của câu đố tác nhân và khối lượng công việc thương mại hàng ngày đo lường những thứ khác nhau.

Bản thân Giải thưởng ARC coi bài tập này là đo lường “khoảng cách còn lại” giữa AI và AGI hiện tại, định nghĩa AGI là khả năng đạt được bất kỳ kỹ năng nào mà con người có thể, hiệu quả như con người có thể. Một điểm số gần như hoàn hảo trong điều kiện thuận lợi không tự nó thu hẹp được khoảng cách đó. Và ở mức từ 17.000 đến 50.000 USD cho mỗi lần đánh giá, chỉ những phòng thí nghiệm có nguồn lực tốt mới có đủ khả năng chạy điểm chuẩn ở quy mô này - mặc dù dữ liệu chi phí của ARC Prize cho thấy lý do thông minh hơn thực sự có thể giảm chi phí.

Tại sao nó lại quan trọng

Hiệu quả hành động là một trục so sánh thực sự mới. Một mô hình có thể giải quyết mọi cấp độ nhưng lãng phí hàng nghìn cuộc gọi khi thực hiện nó sẽ kém hữu ích hơn — và đắt hơn — so với mô hình hoạt động như Astra đã làm ở đây: khám phá có chủ ý, nén những gì nó học được và hành động theo nó. Cho dù người ta kết luận thế nào về cuộc tranh luận về AGI, dữ liệu của Giải thưởng ARC cho thấy các đặc vụ biên giới hiện đang đối chiếu với con người không chỉ về việc liệu họ có thể giải quyết các vấn đề mới hay không mà còn về cách họ giải quyết chúng về mặt kinh tế.

Đi trước AI

Mọi kết quả điểm chuẩn, ra mắt mô hình và tranh luận về an toàn, đều được theo dõi khi nó diễn ra — đọc thêm tin tức AI →