GPT-6 Astra của OpenAI có thể đang gặp khó khăn với các vấn đề về niềm tin của người dùng trên mặt trận mã hóa, nhưng trên một tiêu chuẩn robot mới, nó đang đăng những con số khiến các nhà nghiên cứu nói về một bước nhảy vọt về chất. Trên StationeryBench, một bài kiểm tra được xây dựng xung quanh các đồ vật để bàn thông thường, Astra đã hoàn thành đầy đủ 7 trên 100 nhiệm vụ trong khi MolmoAct2 của Ai2, mô hình mà nó đọ sức, hoàn thành con số 0.
Điểm chuẩn, được mô tả bởi The Decoder, đặt hai mô hình đối đầu với nhau trong năm nhiệm vụ trên bàn làm việc - mở nắp bút đánh dấu, đổ kẹp giấy hoặc đưa thước giữa hai cánh tay robot. Cả hai mô hình đều điều khiển các robot YAM hai cánh tay giống nhau trong suốt 200 thử nghiệm, một thiết kế điều khiển nhằm tách biệt khả năng của mô hình khỏi những khác biệt về phần cứng. Tất cả kết quả, video và mã đã được xuất bản trên GitHub. Để biết thêm thông tin về nghiên cứu như thế này, hãy xem trung tâm tin tức AI của chúng tôi.
Một 'bước thay đổi', theo các nhà nghiên cứu
Yoav Artzi, một nhà nghiên cứu AI tại Cornell và Google DeepMind, gọi hiệu suất của Astra là “một bước thay đổi trong lý luận không gian” – loại kết quả điểm chuẩn ngôn ngữ hiếm khi đạt được. Trên một tiêu chuẩn vẫn chưa được công bố có tên REMAP, Astra đạt độ chính xác gần bằng mức độ con người, mặc dù Artzi lưu ý rằng "ngay cả Astra cũng không đạt được những gì con người làm trong các tình huống khác."
Điểm tiến bộ trung bình của Astra đạt 46/100, so với 12 của MolmoAct2 - một khoảng cách quan trọng hơn những con số hoàn thành tiêu đề gợi ý. Các nhiệm vụ của robot được xếp loại dựa trên tiến độ một phần cũng như thành công hoàn toàn và việc tăng gấp ba lần số điểm trung bình của đối thủ cho thấy mô hình này luôn tiến xa hơn thông qua các chuỗi thao tác thay vì thành công nhờ may mắn trong một số thử nghiệm.
Tại sao lý luận không gian đột nhiên có vấn đề
Kết quả gợi ý về cách Astra được đào tạo. Artzi nghi ngờ OpenAI đã đào tạo mô hình trên một lượng lớn dữ liệu 3D, chẳng hạn như các cảnh trong Blender, sẽ phù hợp với sức mạnh đặc biệt của mô hình trong các tác vụ 3D. Nếu cách đọc đó đúng, nó cho thấy môi trường 3D tổng hợp – rẻ hơn và an toàn hơn so với việc thu thập dữ liệu trong thế giới thực – đang trở thành một con đường khả thi để đạt được năng lực trong thế giới vật lý, một trong những điểm nghẽn lâu đời nhất trong chế tạo robot.
Thiết kế của điểm chuẩn cũng nói lên điều gì đó về việc đánh giá robot đang hướng tới đâu. Các nhiệm vụ của StationeryBench rất nhàm chán — mở nắp bút, đổ kẹp giấy, đưa thước — bởi vì thao tác hàng ngày, chứ không phải kỳ công điện ảnh, là thứ phân biệt các bản demo trong phòng thí nghiệm với các máy móc hữu ích. Việc chấm điểm cả hai mô hình trên cùng một phần cứng YAM hai nhánh qua 200 thử nghiệm và xuất bản mọi video là một thiết lập minh bạch bất thường cho tuyên bố về khả năng liên quan đến phòng thí nghiệm hàng đầu của phòng thí nghiệm biên giới.
MolmoAct2, mô hình so sánh của Viện AI Allen (Ai2), không hoàn thành nhiệm vụ nào là loại dữ liệu riêng của nó: nó cho thấy khoảng cách giữa các mô hình biên giới cho mục đích chung và các mô hình robot được xây dựng có mục đích không còn chỉ dừng lại mà còn đảo ngược, ít nhất là về thao tác nặng về lý luận.
Nó cũng phù hợp với tham vọng đã nêu của OpenAI: công ty có kế hoạch dài hạn để chế tạo robot tiêu dùng của riêng mình, theo báo cáo được trích dẫn bởi The Decoding. Một mô hình ngôn ngữ biên giới có thể suy luận về các vật thể, bàn tay và quỹ đạo là một nửa phần mềm của cao độ đó. Một nửa phần cứng vẫn chưa được giải quyết, nhưng các điểm chuẩn như StationeryBench là cách đo lường câu chuyện đó.
Bối cảnh: Một mô hình với một tuần phức tạp
Kết quả là một chu kỳ tin tức kỳ lạ đối với OpenAI. Mô hình tương tự ở trung tâm của điểm chuẩn này đã dành cả tuần để đối mặt với những lời phàn nàn của người dùng rằng nó đã trở nên tồi tệ hơn kể từ khi ra mắt - những lời phàn nàn mà OpenAI truy tìm đến ba lỗi được đặt tên, từ kỹ năng không phù hợp đến thử nghiệm ngữ cảnh hoạt động sai, trước khi đặt lại giới hạn sử dụng Codex. Một mô hình gặp trục trặc trong quá trình sản xuất khi đăng các kết quả thay đổi từng bước trong phòng thí nghiệm là bản tóm tắt của ngành AI hiện tại: khả năng và độ tin cậy đang tiến bộ trên các đồng hồ khác nhau.
Nó cũng diễn ra trong bối cảnh đang có một cuộc tranh luận về an toàn mà chính lãnh đạo của OpenAI đã tham gia. Nhà khoa học trưởng của công ty đã cảnh báo rằng không có phòng thí nghiệm nào giải quyết được việc kiểm soát các hệ thống ngày càng tự chủ và Giám đốc điều hành của Anthropic đã kêu gọi ngành này hoàn toàn làm chậm quá trình phát triển biên giới. Điểm chuẩn cho thấy các mô hình thao túng thế giới vật chất - ngay cả khi thế giới chỉ là một chiếc bàn phủ đầy văn phòng phẩm - chính xác là loại kết quả mà cả hai giám đốc điều hành đều trích dẫn khi họ cho rằng tốc độ tiến bộ đang vượt xa sự giám sát.
Điểm mấu chốt
Bảy nhiệm vụ đã hoàn thành đầy đủ trong số 100 nhiệm vụ sẽ không đặt robot lên bàn làm việc của bạn vào ngày mai. Nhưng đi từ điểm 0 lên điểm 7 của đối thủ, với điểm tiến bộ trung bình cao hơn ba lần, là kiểu gián đoạn đã vẽ lại biểu đồ khả năng hiểu ngôn ngữ hai năm trước. Câu hỏi mở là liệu mô hình tương tự có thể cung cấp năng lực đó một cách đáng tin cậy, ngoài mức chuẩn, ở mức giá mà các nhà phát triển sẵn sàng trả hay không.
Đi trước AI
Các tiêu chuẩn, những đột phá và cuộc chạy đua hướng tới những cỗ máy có thể hành động — diễn ra hàng ngày.
Đọc thêm tin tức về AI →