Patronus AI 是一家构建模拟数字环境来评估自主 AI 代理的初创公司,随着对可靠代理测试的需求激增,该公司在 B 轮融资中筹集了 5000 万美元。据 TechCrunch 报道,本轮融资由 Greenfield Partners 领投,Notable Capital、Lightspeed、Datadog 和三星跟投,使该公司的融资总额达到 7000 万美元。
新问题:走捷径的代理 更多相关背景,请参阅我们的AI最新动态。
随着人工智能代理从回答问题发展到自动执行复杂的多步骤任务,模型提供商和构建此类代理的初创公司需要确保系统能够在各种场景中可靠地执行。人工智能实验室经常使用基准来展示模型的能力,但在面向代理的基准上获得高分并不能证明人工智能实际上可以正确完成现实世界的工作。
这个差距正是守护神人工智能关注的焦点。这家总部位于旧金山的公司由前 Meta AI 研究人员阿南德·坎纳潘 (Anand Kannappan) 和丽贝卡·钱 (Rebecca Qien) 于 2023 年创立,致力于构建所谓的“数字世界模型”,即网站和内部系统的复制品,代理在训练后会在其中进行压力测试。使用强化学习对代理进行评估,它会迭代地奖励成功完成任务并惩罚错误。
向自动驾驶汽车借款
该公司将其方法与 Waymo 训练自动驾驶汽车的方法进行了比较,首先构建合成世界来测试车辆应对罕见危险的能力,例如恶劣天气或儿童追球。人工智能代理的主要区别在于它们倾向于走捷径,这意味着即使看起来成功,它们也无法正确完成任务。
Notable Capital 董事总经理格伦·所罗门 (Glenn Solomon) 表示:“守护神非常擅长发现黑客行为,并确保他们追究模型的责任。”所罗门表示,对该公司模拟环境的需求几乎无法满足。事实上,每个前沿人工智能实验室和许多新兴初创公司现在都是客户,Patronus 的收入在过去一年增长了 15 倍。
扩展到可验证的任务之外
目前,Patronus 为软件工程和金融提供模拟数字世界,这两个领域的结果相对容易验证。但该公司认为这只是一个开始。 “今天我们非常关注可验证的问题,即可以立即检查和验证的问题,但还有很多领域非常不可验证或很难验证,”坎纳潘说。
我们的目标是建立足够大的环境来长期测试代理。 “我们希望能够真正创建一个环境,让您可以运行一个可以运行 10 小时、10 天或 10 周的代理,”Kannappan 说。流程可验证并不意味着它们很简单,并且能够在长达数天的工作流程中发现代理失败的能力是公司价值主张的核心。
这笔资金到来之际,更广泛的人工智能行业正在努力解决如何衡量进展的问题。基准分数已成为一种有争议的货币,批评者认为模型可以针对特定于游戏的测试进行优化,而无需真正改进实际任务。守护神的模拟环境提供了另一种选择,在开放式场景中测试代理,其中成功的唯一证明是正确完成的工作,而不是排行榜上的数字。
对于企业客户来说,这种区别很重要。通过基准测试但默默地将错误引入生产代码库的编码代理,或者错误舍入数字的财务代理,可能会造成比低测试分数所暗示的更大的损害。通过在部署之前在沙箱中捕获这些故障,Patronus 将评估定位为信任的先决条件,而不是事后的想法。
拥挤领域中的独特方法
至于竞争对手,Patronus 认为它主要是与人工智能实验室已经建立的用于评估智能体行为的内部评估团队竞争。 Mercor 和 Surge 等人类数据公司帮助模型制作者进行强化学习,而 Patronus 的运作方式有所不同,它在没有任何人类参与的情况下评估智能体的行为方式,自动检测故障,否则需要昂贵的人工审查。
此轮融资表明投资者对代理评估将成为人工智能堆栈的基础层充满信心。随着代理承担更多自主工作,从预订旅行到进行财务分析,能够在部署之前证明这些系统值得信赖的初创公司将自己定位为代理人工智能时代不可或缺的看门人。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →


