Jev 是来自初创公司 TypeSafe AI 的非法学硕士“决策模型”,根据该项目的网站,它已经完成了《神奇宝贝红》——在 37 小时 40 分钟的游戏时间内从 Pallet Town 一路奋战到名人堂,总计算成本约为 1.65 美元。

此次跑步活动由开发人员 Christian Mathiesen 构建,进行了现场直播,并展示了代币和成本,并在 GitHub 上开源。周末,它登上了《黑客新闻》的头版,吸引了数百名点赞,并引发了关于人工智能代理未来的热烈讨论。 Tom's Hardware 报道了这一成就,指出非 LLM 引擎在传统聊天机器人停滞数月的情况下取得了成功,并且 Claude Opus 5 指导该模型走出了死胡同。

数字奔跑

该项目自己跟踪的统计数据表明,对于人工智能系统来说,这次运行是多么不寻常:

  • 总时间: 37 小时 40 分钟
  • 做出的决定: 16,150
  • 输入代币: 大约 3920 万个
  • Jev 总成本: 约 1.65 美元
  • 典型决策时间: 0.4 秒
  • 对阵对手: 约 1,660
  • 团队擦拭: 16
  • 四强尝试: 15
  • 最艰难的路段:胜利路

最后一支名人堂队伍:喷火龙,等级 83,支持者有 Graveler (62)、Nidoqueen (45)、Beedrill (44)、Haunter (39) 和 Primeape (29)。

经济是头条新闻。花费不到一杯咖啡的价格就能做出一万六千个决策,这与基于 LLM 的游戏代理形成鲜明对比,后者可以在长时间的会话中消耗数十美元的代币。马蒂森说,他在断定杰夫可以很快做出决定后选择了《神奇宝贝》,但还不够快来玩《毁灭战士》。

为什么《精灵宝可梦红》对 AI 来说很难

《神奇宝贝红》不太可能成为代理人工智能的基准。 1996 年的 Game Boy 经典游戏需要长期规划:磨练关卡、管理六人队伍、在没有地图的情况下穿越迷宫般的洞穴,以及在错过关键项目时回溯。历史上,语言模型智能体一直在原地踏步,陷入困境,并在多余的行动上浪费了大量预算。

杰夫采取了一种完全不同的方法。该模型不是生成文本,而是直接返回经过校准的决策——TypeSafe AI 的这一设计已作为“系统一”的替代品进行营销,以替代大型模型的深思熟虑、语言繁重的推理。根据 Tom's Hardware 对该模型的早期报道,该公司声称 Jev 在决策任务上比 LLM 替代方案快大约 193 倍,便宜 445 倍。

开发人员承认,问题是杰夫需要帮助。根据 Tom's Hardware 的说法,Claude Opus 5 指导决策模型走出了死胡同——一种混合方法,其中大型语言模型提供战略指导,而快速、廉价的模型执行数千个单独的决策。项目页面讽刺地指出,杰夫“只知道下一步该去哪里,因为它有一个指南。”

这对 AI 代理意味着什么

结果是越来越多的争论中的一个数据点,即人工智能代理的未来不是一个包揽一切的巨型模型,而是一种分工:快速、廉价、专门的模型处理高频决策,只有当情况变得模糊时,较慢的推理模型才会介入。

对于机器人、游戏和实时控制系统(决策必须在毫秒内到达且预算以美分衡量的领域),这种架构很有吸引力。仓库机器人、玩游戏的 NPC 或交易系统无法承受每个微动作都需要 2 秒的 GPT 式往返。

Hacker News 的怀疑论者指出了这次比赛的警告:这款游戏已经有几十年的历史了,并且有完整的记录,教练模型承担了战略重任,15 次精英四人赛的尝试意味着大量的尝试和错误。这些都是公平的观点——但他们错过了更有趣的信号。 16000 个好的决策,每个决策的价格为 0.0001 美元,这正是自治代理大规模运行所需的成本配置。

TypeSafe AI 由前 OpenAI RLHF 研究员创立,将 Jev 定位为语言模型的补充而不是替代品。 Pokémon 项目(所有公开的代码、流和成本细分)是决策优先堆栈功能的最生动的演示。

完整的源代码可以在 GitHub 上找到,完整的运行可以在 YouTube 上观看,包括胜利路上的每一次擦拭。

保持人工智能领先

关注AI Buzz Wire了解最新的人工智能发展。

阅读更多人工智能新闻 →