人工智能基准决定哪些模型会成为头条新闻,而构建这些模型的公司已经学会了如何击败它们。一家成立于 2024 年、名为 Vals 的初创公司押注该行业需要一位测试无法被欺骗的裁判,而投资者刚刚大力支持了这一赌注:继 8VC 和 Bloomberg Beta 领投的种子轮融资后,Vals 上个月筹集了由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资。
该公司的崛起之际,人们对如何衡量人工智能能力以及当衡量标准成为营销工具时会发生什么越来越感到不安。更多关于人工智能业务的内容,请关注【人工智能行业报道】(https://aibuzzwire.news)。
当基准成为营销时
基准测试已成为验证人工智能模型能力的行业规范,并且当数据出现有利于公司的方向时,基准测试已成为验证其相对于竞争对手的广告优势的行业规范。良好的基准意味着良好的公共关系。
Vals 联合创始人兼首席执行官 Rayan Krishnan 表示,问题在于许多遗留基准是为上一代模型构建的,而公司已经找到了如何针对它们进行优化的方法。当测试材料公开时,可以有效地训练模型以通过考试——业界将这种做法描述为污染、过度拟合或彻底作弊。
克里希南在接受 TechCrunch 采访时表示:“我们看到许多新的、功能强大的模型迅速进入市场,而学术基准却跟不上前沿的进步。”
私人测试,真实世界任务
瓦尔斯在两个方面采取了不同的方法。首先,它没有公开披露其具体的测试材料,这使得公司更难根据考试训练其模型。其次,Vals 不是衡量抽象知识(模型是否可以回答律师考试式的问题),而是评估模型如何在法律、金融和编码等特定行业中执行复杂的任务。
“我们正在做的实际上是研究模型的真正影响,”克里希南说。 “他们的工作能否在每个领域生产出与人类具有相同质量的产品?”
该公司还衡量失败模式,而不仅仅是成功。克里希南表示,瓦尔斯的目标是分析“如果这些模型在世界上失控,将会产生什么负面影响”——这种评估哲学将下行风险视为可衡量的产出,而不是事后的想法。
从法律和金融到日内瓦公约和递归自我完善
瓦尔斯的评估范围不断扩大,超出了其专业服务的范围。克里希南表示,除了法律、财务和编码基准之外,该公司现在还运行心理健康、网络安全和生物安全方面的测试,甚至还运行递归自我完善的基准——这是人工智能安全圈中比商业评估套件更常讨论的话题。
也许最引人注目的是其在武装冲突法方面的工作,瓦尔斯正在测试模型如何理解和应用《日内瓦公约》。广度表明了需求的来源:不仅是争夺顶级排行榜的实验室,而且是在部署模型之前需要模型在高风险领域表现的证据的企业和机构。
商业模式:付费参加测试
公司付钱给 Vals 来评估他们的模型——这种安排似乎有悖常理。为什么公司要为可能令自己难堪的结果买单?克里希南将该模型与向大学理事会付费参加 SAT 考试的学生进行了比较:一项独立的衡量标准,即使是不讨人喜欢的衡量标准,也能帮助公司解决问题并随着时间的推移不断改进。
市场似乎正在做出回应。 Vals 表示,目前其收入是去年的八倍,其团队自今年年初以来增加了两倍,从 8 人增加到 25 人。该公司在旧金山福尔瑟姆街 (Folsom Street) 的两层办公室开展业务,福尔瑟姆街以前是一座啤酒厂大楼,现在拥有多家初创公司。
该公司表示,评估也正在成为企业购买人工智能模型的决策因素,使基准的作用更接近于尽职调查而不是营销。
坐在前排的 25 岁创始人
25 岁的 Krishnan 在 Palantir 实习,在斯坦福大学读本科时,曾在微软和该大学著名的人工智能实验室工作。他说,Vals 的诞生是因为看到评估落后于它应该衡量的行业——随着新模型的出现速度快于设计、验证和发布学术基准的速度,这种差距只会扩大。
这家初创公司现在加入了一小群规模虽小但不断壮大的公司行列,试图将人工智能评估制度化,其中包括学术工作、开源排行榜项目和安全机构。 Vals 的与众不同之处在于它的私人测试模式,以及它注重付费、针对特定行业的评估而不是公开排名。
为什么它很重要
人工智能行业的基准可信度问题是有据可查的:泄露的测试集、可疑的排行榜跳跃以及超过现实世界表现的营销声明。如果购买者——尤其是企业和政府——开始依赖像瓦尔斯这样的私人、基于任务的评估,模型开发者的激励可能会从教学转向测试,转向真正的能力。
这离解决还有很长的路要走。私人基准仍然要求买家信任裁判,而瓦尔斯的客户正是被评级的公司。但凭借 4000 万美元的 A 轮融资、八倍的收入增长以及涵盖金融和生物安全的需求,我们可以押注独立情感评估正在成为基础设施——无论结果是否令人满意,人工智能经济都会为此付出代价。
保持人工智能领先地位
谁来测量测量者?在 AI Buzz Wire 上关注人工智能评估业务以及重塑该业务的初创公司,这里是您的重大人工智能新闻 的来源。
阅读最新的人工智能新闻 →