OpenAI 的 GPT-6 Astra 为其记录添加了一个不寻常的奖杯:完整通关 Valve 标志性的第一人称益智游戏 Portal,在 24 小时内自主完成,总计算成本为 571.18 美元。 The Verge 于 2026 年 9 月 6 日报道了这一里程碑,归功于一位名为 cosyblaze 的用户,他将前沿模型连接到游戏中,并让它自行解决剩下的问题。

尽管 Portal 已经很老了,但对于 AI 代理来说,它仍然是一项艰巨的测试。该游戏由 Valve 于 2007 年发布,要求玩家使用传送枪来推理空间谜题,在墙壁、地板和天花板上创建相连的开口,以穿过通常违背直觉的测试室。没有可依靠的战斗磨练,也没有可遵循的任务标记;每个房间本质上都是一个物理谜题。对于关注前沿模型如何进行压力测试的读者来说,这次运行是我们的人工智能发展报道中的一个生动的条目。

从演示视频到完整完成

这次逃跑并不是凭空而来的。 9 月 6 日早些时候,一段显示 GPT-6 Astra 玩 Portal 的 YouTube 视频在 Hacker News 上流传,随后一篇指出该模型“自主完成”游戏的帖子引起了人们的关注。 The Verge 的报告证实了细节:整个游戏在 24 小时内通关,计算成本不到 600 美元,并为怀疑者发布了运行的压缩视频。

The Verge 忍不住量化了该法案的环境方面,并指出这次运行可能消耗了大约一个小游泳池的数据中心冷却水量。这是一个讽刺的提醒,代理游戏运行对用户来说很便宜,但对地球来说却不是免费的。

为什么 2007 年的益智游戏是一个严肃的基准

Beating Portal 不像 ARC-AGI 或 SWE-bench 那样是一个预定的基准测试,这也是它引起共鸣的部分原因。该游戏所需要的技能正是历史上将人类与人工智能系统区分开来的技能:

  • 空间推理。 解决方案需要预测门户出口将在何处发射玩家的身体 - 三维物理推理多年来一直困扰着特工。
  • 长期规划。 钱伯斯连锁多个步骤;最后一步失败通常意味着从头开始重做该序列。
  • 从失败中学习,无需亲自指导。 没有任何提示。智能体必须通过反复试验推断游戏规则,然后将其推广到新的房间。

今年早些时候,OpenAI 的 GPT-6 Astra 在专注于代理推理的 ARC-AGI-3 基准测试中名列前茅,该模型引起了人们对计算机使用能力的关注,即以人的方式操作软件界面的能力。 Portal 运行是对相同技能集的有趣而真实的展示:感知、计划和控制,在没有人工干预的情况下展开数小时。

更广泛浪潮的一部分

这次运行也是人工智能游戏在 2026 年落地的一个标志。基准分数现在与文化里程碑共享空间:创作巴赫赞美诗的模型、击败手写校正识别测试,以及完成曾经代表“计算机永远不会做到这一点”这句话的游戏。每一次通过都解除了一种旧的确定性,并提出了下一次会是什么的问题。

也有实际意义。让 Cosyblaze 的设置引导 Portal 的循环(输入屏幕截图,做出决策,花费数百美元)与软件测试、机器人和计算机使用助手产品化的循环相同。一个能够在完整游戏过程中牢记游戏物理原理的模型原则上可以完成冗长、混乱的软件任务,从而击败较短的上下文系统。

不过,就目前而言,要点更简单。人工智能以大约新 GPU 押金的价格从头到尾解决了游戏中最受欢迎的谜题之一,并发布了视频。 Aperture Science 的测试室旨在让人类感觉自己很聪明。这个周末,他们让模型看起来很流畅。

跑步是如何被接收的

人们的反应大致追踪了人工智能游戏里程碑的轨迹:首先是怀疑,然后是视频,然后是接受。在《黑客新闻》上,这次运行吸引了源源不断的评论者,他们剖析了该设置的工作原理以及它对代理人工智能的含义——其中一些人指出,总费用低于许多人认为的运行成本。完成的浓缩视频为怀疑者提供了一种亲自验证这一说法的方法,这比大多数基准测试结果提供的要多。

它还邀请人们与之前的里程碑进行比较。几十年来,游戏一直是该领域的公共试验场,从棋盘游戏到实时策略再到开放式沙盒。每当一场比赛失败,争论就会发生变化:今天的怀疑论者坚持认为,这项壮举是狭隘的、专业的,或者在某种程度上是专业的,无法概括。门户网站在这段历史中之所以引人注目,是因为它的设置非常普通——一个商业可用的前沿模型、一个消费者游戏和几百美元的计算,而不是专门为游戏训练的定制研究系统。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →