本周,一家名为 TypeSafe AI 的初创公司从两年的隐秘状态中脱颖而出,大胆宣传:该行业一直在构建错误的自动化模型。它的第一个产品是一个名为 Jev 的系统,被该公司称为“System One Model”,它很快成为 Hacker News 上讨论最多的故事,获得了 1,800 多个点。
“多年来,模特在聊天方面一直表现得超人,那么所有的自动化都在哪里呢?”该公司在其发布帖子中问道。该创始人是一名前 OpenAI 研究员,他表示,他在那里帮助建立的方法成为了 ChatGPT 背后的研究,他曾经相信聊天模型将导致通用人工智能,但后来得出结论,缺少了一些重要的东西。 更多相关背景,请参阅我们的AI最新动态。
什么是系统一模型?
这个名字借鉴了心理学对快速、直观的系统一思维和缓慢、深思熟虑的系统二推理的区别。当今的大型语言模型逐个生成文本标记,而 Jev 旨在做出软件可以直接使用的快速、结构化决策。
该公司将该模型描述为“前沿情报功能调用:输入非结构化状态,输出类型化概率决策”。 Jev 不是生成必须解析和验证的散文,而是输出预定义的结构化值,每个值都附有校准的概率和置信度分数。该公司声称该模型永远不会出现类型错误,也不会像文本模型那样产生幻觉,尽管此类供应商声称在独立评估之前需要进行审查。
架构上的差异在于交付机制。根据这篇文章,Jev 在一次并行传递中生成所有输出,而不是一次一个令牌的自回归方式。该公司表示,放弃自由格式的字符串生成正是它的速度之所在:输出是同时计算的,而不是顺序计算的。
新的训练方法
TypeSafe 表示,它在底层构建了一个新的堆栈:自定义模型架构、并行采样器和一种称为校准决策强化学习(RLCD)的训练方法。该公司将 RLCD 定位为与业界两种主导方案相对应的。根据人类反馈进行强化学习,优化人类评估者喜欢的反应;具有可验证奖励的强化学习优化了可以通过编程方式检查的输出。相反,RLCD 训练模型将认知上诚实的概率附加到快速判断任务的答案上。
根据该公司的说法,结果是:更高的置信度应该与更高的准确性相关,并且相似的输入应该产生一致的输出,当模型的决策直接连接到生产软件时,这些属性很重要。
性能和定价声明
即使按照初创公司的标准,这些说法也很激进。 TypeSafe 表示,Jev 在所谓的系统一任务上达到了与现有法学硕士类似的智能,同时针对这些查询形状的运行速度提高了 40 倍到 200 倍。该公司的主页引用了速度提高 193.6 倍、成本降低 444.6 倍的数字,尽管该博客文章承认这些“处于现实世界收益的高端”。该公司还表示,该模型的速度约为 100 毫秒,足以将人工智能判断嵌入延迟至关重要的面向用户的工作流程中。
定价遵循非传统设计。 TypeSafe 列出的输入代币为每百万代币 0.042 美元,约合每十亿美元 42 美元,并指出通常的 LLM 成本结构是相反的:因为 Jev 并行生成结构化输出而不是生成长字符串,所以分类账中昂贵的输出代币部分基本上消失了。该公司将此与传统模型进行比较,传统模型中输出代币的成本通常是输入代币的几倍。
收据及其限制
值得赞扬的是,发布帖子试图通过并排演示来证实炒作。在其标题比较中,该公司使用了具有默认推理功能的 GPT-5.6 Terra,该公司将其描述为在平均智力方面与 Jev 最具有可比性的模型。评估中的参考答案是根据 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Fable 5.1 的平均值计算的,该公司承认这一选择会使其与现有实验室的比较产生偏差。 LLM 方面的成本和延迟数据来自 OpenRouter,该公司指出 OpenRouter 引入了自己的路由偏差。
该方法论部分对于发布公告来说异常坦率,这也是怀疑论者关注的焦点。所有标题数字都来自公司自己选择的任务,这些任务被描述为可以分类、路由、评分、提取或分支的决策,这正是其架构所喜欢的形状。目前还没有独立的基准测试,公司自己的框架承认比较取决于查询选择。
Why the Launch Resonated
《黑客新闻》受到了热烈的欢迎,该帖子一天之内就突破了 1,800 点,这表明该帖子触动了真正的神经。构建人工智能产品的开发人员花了两年的时间来解决令人印象深刻的演示和可靠的自动化之间的差距:幻觉的工具调用、不一致的判断、昂贵的缓慢推理步骤链与脆弱的粘合代码。
TypeSafe 的赌注是,现实世界人工智能工作负载中有意义的份额根本不需要喋喋不休的模型。欺诈检查、支持票分类、线索评分、内容审核、日志分析和无数的路由决策从根本上来说是具有明确定义的输出空间的分类问题。对于这些人来说,以毫秒为单位返回校准概率的专门模型可能会在速度和成本上削弱通用法学硕士。
反驳也很常见:通用模型不断变得更好、更便宜,而灵活的字符串接口使法学硕士变得不可预测,这也使它们无需重新训练就能适应新任务。狭窄的决策引擎必须找到足够的同质工作负载量来证明其存在的合理性。
Jev 从本周开始可抢先体验。无论它成为一个新类别还是一个好奇的脚注,这次发布都为行业争论增添了一个独特的声音,而这个争论只会越来越响亮:人工智能自动化的最快路径可能不是通过更大的聊天机器人,而是通过根据第一原理设计的模型,快速准确地做一件事,并告诉你它们有多确定。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →