GPT-6 Astra của OpenAI đã bổ sung thêm một danh hiệu bất thường vào kỷ lục của mình: một bản chơi đầy đủ của Cổng thông tin giải đố góc nhìn thứ nhất mang tính biểu tượng của Valve, được hoàn thành một cách tự động trong vòng chưa đầy 24 giờ với tổng chi phí điện toán là 571,18 USD. The Verge đã báo cáo cột mốc quan trọng này vào ngày 6 tháng 9 năm 2026, ghi nhận một người dùng có tên là Cosyblaze, người đã kết nối mô hình biên giới với trò chơi và để nó giải quyết phần còn lại.

Portal là một bài kiểm tra khắt khe đối với một tác nhân AI bất chấp tuổi tác của nó. Được Valve phát hành vào năm 2007, trò chơi yêu cầu người chơi suy luận về các câu đố không gian bằng cách sử dụng súng cổng - tạo ra các lỗ liên kết trên tường, sàn và trần nhà để di chuyển qua các phòng thử nghiệm thường xuyên thách thức trực giác. Không có chiến đấu khó khăn để dựa vào và không có điểm đánh dấu nhiệm vụ để theo dõi; mỗi căn phòng về cơ bản là một câu đố vật lý. Đối với độc giả đang theo dõi cách các mô hình biên giới đang được thử nghiệm căng thẳng, lần chạy này là một mục nhập sinh động trong phạm vi đưa tin về phát triển AI của chúng tôi.

Từ Video Demo đến Hoàn thành đầy đủ

Cuộc chạy đua không hề tự nhiên mà có. Trước đó vào ngày 6 tháng 9, một video YouTube cho thấy GPT-6 Astra chơi Portal đã được lan truyền trên Hacker News và một bài đăng tiếp theo lưu ý rằng mô hình này đã "tự động hoàn thành" trò chơi đã thu hút sự chú ý trong ngày. Báo cáo của The Verge đã xác nhận các chi tiết: toàn bộ trò chơi, hoàn thành trong vòng chưa đầy 24 giờ, với số tiền tính toán chưa đến 600 đô la - với một đoạn video cô đọng về cuộc chạy được xuất bản cho những người hoài nghi.

The Verge không thể cưỡng lại việc định lượng khía cạnh môi trường của dự luật, lưu ý rằng hoạt động này có thể tiêu tốn lượng nước tương đương với một bể bơi nhỏ để làm mát trung tâm dữ liệu. Đó là một lời nhắc nhở buồn cười rằng các hoạt động chơi game tác nhân có giá rẻ đối với người dùng nhưng không miễn phí đối với hành tinh này.

Tại sao Puzzler 2007 lại là một chuẩn mực nghiêm túc

Beating Portal không phải là điểm chuẩn được lên lịch như ARC-AGI hay SWE-bench và đó là một phần lý do tại sao nó gây được tiếng vang. Trò chơi đòi hỏi chính xác những kỹ năng đã tách biệt con người khỏi hệ thống AI trong lịch sử:

  • Lý luận không gian. Các giải pháp yêu cầu dự đoán nơi lối ra cổng sẽ phóng cơ thể người chơi — lý luận vật lý ba chiều đã khiến các đặc vụ gặp khó khăn trong nhiều năm.
  • Lập kế hoạch dài hạn. Phòng chuỗi nhiều bước; Thất bại ở bước cuối cùng thường có nghĩa là phải làm lại trình tự từ đầu.
  • Học từ thất bại mà không cần nắm tay. Không có gợi ý. Đặc vụ phải suy ra các quy tắc của trò chơi thông qua việc thử và sai, sau đó khái quát hóa chúng cho các phòng mới.

Đầu năm nay, GPT-6 Astra của OpenAI đã đứng đầu các điểm chuẩn ARC-AGI-3 tập trung vào lý luận tác nhân và mô hình này đã thu hút sự chú ý về khả năng sử dụng máy tính – khả năng vận hành các giao diện phần mềm theo cách một người có thể làm. Cuộc chạy Portal là một minh chứng vui tươi nhưng chân thực về bộ kỹ năng tương tự: nhận thức, lập kế hoạch và kiểm soát, được thực hiện trong nhiều giờ mà không có sự can thiệp của con người.

Một phần của làn sóng rộng lớn hơn

Cuộc chạy đua này cũng là dấu hiệu cho thấy trò chơi AI đã cập bến vào năm 2026. Điểm chuẩn hiện chia sẻ không gian với các cột mốc văn hóa: người mẫu soạn hợp xướng Bach, vượt qua các bài kiểm tra nhận dạng sửa lỗi viết tay và hoàn thành các trò chơi từng đại diện cho cụm từ "máy tính sẽ không bao giờ làm được điều này". Mỗi lần vượt qua sẽ làm giảm bớt một sự chắc chắn cũ và đặt ra câu hỏi về lần tiếp theo sẽ là gì.

Có những ý nghĩa thực tế, quá. Vòng lặp tương tự cho phép thiết lập của Cosyblaze điều khiển Cổng thông tin - chụp ảnh màn hình, đưa ra quyết định, với chi phí vài trăm đô la - là vòng lặp được sản xuất để kiểm tra phần mềm, robot và trợ lý sử dụng máy tính. Về nguyên tắc, một mô hình có thể ghi nhớ các yếu tố vật lý của trò chơi để chơi hết là mô hình có thể xử lý các tác vụ phần mềm dài dòng, lộn xộn để đánh bại các hệ thống có ngữ cảnh ngắn hơn.

Tuy nhiên, hiện tại, việc mua mang đi đã đơn giản hơn. Một AI đã đánh bại một trong những câu đố được yêu thích nhất trong trò chơi, bắt đầu hoàn thành với mức giá đặt cọc của một GPU mới — và đăng video. Các phòng thử nghiệm của Aperture Science được thiết kế để khiến con người cảm thấy thông minh hơn. Cuối tuần này, họ đã làm cho một người mẫu trông trôi chảy.

Cuộc chạy được đón nhận như thế nào

Phản hồi theo dõi các cột mốc quan trọng của trò chơi AI nói chung: đầu tiên là sự hoài nghi, sau đó là video, sau đó là sự chấp nhận. Trên Hacker News, cuộc chạy đã thu hút một lượng lớn người bình luận mổ xẻ cách thức hoạt động của thiết lập và ý nghĩa của nó về AI tác nhân - với một số lưu ý rằng tổng hóa đơn thấp hơn so với nhiều người cho rằng một cuộc chạy như vậy sẽ tốn kém. Đoạn video cô đọng về quá trình hoàn thành đã cung cấp cho những người hoài nghi một cách để tự xác minh tuyên bố, điều này vượt xa hầu hết các kết quả điểm chuẩn đưa ra.

Nó cũng đưa ra sự so sánh với các cột mốc quan trọng trước đó. Trò chơi đã đóng vai trò là nơi chứng minh công khai của lĩnh vực này trong nhiều thập kỷ, từ trò chơi trên bàn cờ, chiến lược thời gian thực cho đến hộp cát mở. Mỗi khi một trận đấu thất bại, lập luận lại thay đổi: những người hoài nghi ngày nay nhấn mạnh rằng kỳ tích này rất hẹp, chuyên biệt hoặc chuyên biệt theo một cách nào đó không thể khái quát hóa được. Điều khiến Cổng hoạt động đáng chú ý trong lịch sử đó là cách thiết lập thông thường - một mô hình biên giới có sẵn trên thị trường, một trò chơi dành cho người tiêu dùng và máy tính trị giá vài trăm đô la, thay vì một hệ thống nghiên cứu riêng được đào tạo riêng cho trò chơi.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →