一家由前 OpenAI 研究员创立的新人工智能初创公司推出了所谓的全新模型——一种无法为你写论文的模型,并表示这正是重点。
TypeSafe AI 周二宣布发布其第一个“System One 模型”,名为 Jev,可立即提供抢先体验。该公司由 Diogo Almeida 创立,他表示 ChatGPT 指令跟踪背后的研究源于他在 OpenAI 所做的工作。经过两年的隐秘工作,他认为该行业对聊天的执着掩盖了自动化实际上失败的地方。 更多相关背景,请参阅我们的AI行业报道。
“多年来,模特在聊天方面一直表现得超人,那么所有的自动化都在哪里呢?”阿尔梅达在发布帖子中写道。 “过去四年来,这一直是我的主要问题。”
“系统一”模型实际上是什么
这个名字借鉴了心理学对快速、本能思维和缓慢、深思熟虑的推理的区分。大型语言模型逐个生成文本标记——灵活、通用,并且偶尔会出现自信的废话——TypeSafe 的 Jev 旨在做一些更狭窄的事情:将非结构化状态作为输入,并返回带有校准概率的类型化、结构化决策。
该公司将 Jev 描述为“前沿智能功能调用:输入非结构化状态,输出键入概率决策”。由于可能的输出是提前定义的,并且该模型永远不会生成自由格式的字符串,因此 TypeSafe 声称它不会产生类型错误(该公司表示这一属性是在数学上得到保证的,而不是统计上可能的),并且不会像文本生成模型那样产生幻觉。
根据发布的帖子,该架构在三个方面偏离了主流实践:新的模型架构、在单个查询中而不是顺序生成所有输出的并行采样器,以及该公司称为校准决策强化学习(RLCD)的训练方法,该方法针对认知上诚实的概率而不是人类偏好或以编程方式验证的输出进行优化。
声称:速度提高 100 倍,成本只是成本的一小部分
TypeSafe 发布的数字非常激进。该公司表示,Jev 在所谓的“系统一型”任务(分类、路由、评分、提取和分支决策)上提供的情报可与现有前沿法学硕士相媲美,同时响应时间为 70 至 500 毫秒,而前沿模型的端到端响应时间为 3 至 329 秒。该公司表示,速度提高了 40 倍到 200 倍。
定价同样非常规:每百万个输入代币 0.042 美元,输出代币免费,因为输出是并行计算的,而不是逐个代币生成的。该公司在其帖子中承认,尚无法证明定价在规模上是可持续的。
“非凡的主张需要非凡的证据,”该帖子在提供其所拥有的证据之前写道。
收据——以及怀疑论者的说法
TypeSafe 发布了一个并行演示,将 Jev 与 GPT-5.6 Terra 进行比较,将其描述为具有相似智能的最具可比性的前沿模型,并表示记录的运行中唯一的分歧涉及真正模糊的判断调用。它还引入了一种新的“工作流程评估”方法,该方法可以根据最大的外部模型(OpenAI 的 Astra 和 Anthropic 的 Fable)在固定计算图中的共识来衡量模型,并声称 Jev“拥有近 2 个数量级的帕累托前沿”。
值得注意的是,该公司发表了一篇题为“antibenchmaxxing”的附带文章,解释了为什么它避免传统基准,认为为软件工作流程内的结构化决策而设计的模型无法进行有意义的全局比较。
黑客新闻上的反应从真正的兴奋到尖锐的怀疑不等,该发布在几个小时内就获得了数百个点。一些评论者指出,公开证据主要由演示视频组成,其中包括一个显示为《毁灭战士》游戏循环提供动力的模型的视频,而不是可复制的第三方评估。其他人认为,最好将这种方法理解为一种极其快速、前沿质量的分类器,对部分工作负载有用,而不是法学硕士的替代品。
即使是富有同情心的观察家也明确规定了举证责任。 “是的,他们以怀疑论者的身份说话,但除了几个演示视频之外,没有提供大量证据,”一位评论者写道。 “现场演示会更有说服力。”
为什么它可能很重要
这个球场触及了一个真正的痛点。商业软件中的大部分生产 LLM 调用根本不是生成性的——它们是用散文包装的二元判断、类别分配和路由决策。如果一个模型能够在 70 毫秒内以经过校准的置信度进行这些调用,并且输出成本实际上为零,那么人工智能驱动的软件的经济性将发生巨大变化:实时用户界面变得实用,而对于法学硕士来说过于昂贵而无法实现自动化的管道步骤变得足够便宜,可以在任何地方运行。
TypeSafe 建议的用例包括对数据进行分类和路由、验证和保护 LLM 输出、检测越狱以及对大型数据集进行地图缩减分析(周围代码可以限制模型自由度并捕获错误的工作负载)。
该公司对悬而未决的问题持坦率态度:其发布的评估是在美国西海岸的笔记本电脑上进行的,长期定价的可持续性尚未得到证实。杰夫的情报主张是否能够通过独立测试,将决定“系统一模型”是否成为一个类别或一种好奇心。
抢先体验现已通过公司网站开放。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →