Cerebras Systems 和 OpenAI 分享了超快模式的早期概况,这是一种新的服务层,首先在 OpenAI API 中推出,并由 Cerebras 晶圆级技术提供支持。此次合作使 GPT-5.6 Sol 能够以每秒高达 750 个输出令牌的速度运行,从而以实时速度提供前沿级别的智能。有关最新的 AI 硬件新闻,请访问 AI Buzz Wire

消除速度与智能之间的权衡

人工智能构建者长期以来一直面临着一个根本性的权衡:随着模型规模和智能的扩大,它们会产生更高的计算和数据移动成本,从而减慢响应时间。开发人员被迫在等待高质量结果或在更短的时间内接受较差结果之间做出选择。

GPT-5.6 Sol on Ultrafast Mode 旨在解决这一困境。根据 Cerebras 的说法,根据 Artificial Analysis 报告的输出速度,在快速模式下,该服务的运行速度比 Anthropic 的 Claude Fable 5 快 11 倍,比 Opus 4.8 快 5 倍。

人类的最后考试:速度测试

Cerebras 在 Humanity's Last Exam (HLE) 上对 Ultrafast 进行了与竞争模型的测试,这是一个具有挑战性的基准,由 2,500 个问题组成,通常只有化学、经济学和文学等领域的博士学位人才可以回答。

在 Cerebras 进行的评估中,超快模式下的 GPT-5.6 Sol 在 11 小时 11 分钟内回答了全部 2,500 个 HLE 问题。 《克劳德寓言 5》需要 78 小时 27 分钟,即三天多的连续计算才能得出相同的结论。换句话说,Ultrafast 在一个工作日内处理了人类知识的前沿,以近七倍的速度实现了相当的精度。

Cerebras 于 7 月 10 日使用 GPT-5.6 Sol Ultrafast 和 Codex 在高推理设置上进行了基准测试,并于 7 月 13 日至 15 日使用 Claude Fable 5 和 Claude Code 在高推理设置上进行了基准测试。

现实世界的商业影响

在GDP-Val(具有经济价值的知识工作任务的基准)上,Ultrafast 实现了 5.6 倍的端到端加速,且质量没有下降。这证明了更快的推理如何能够在不牺牲输出质量的情况下加速具有经济价值的工作。

Cerebras 设想 Ultrafast 作为一种工具,适用于每一秒都至关重要的场景。运营网络服务的公司可以使用该技术更快地找出根本原因并解决生产中断问题,从而维护客户信任并防止收入损失。在高风险的网络安全情况下,安全团队可以利用 Ultrafast 快速检测和响应攻击。

速度背后的技术

性能优势源于 Cerebras 的晶圆级引擎架构,该架构专为前沿人工智能工作负载而构建。快速前沿推理的核心挑战是数据移动问题:在传统 GPU 上,大型模型的推理受到内存带宽的瓶颈,因为模型权重必须在片上内存和片外存储之间重复传输以生成连续的令牌。

Cerebras 采用了一种根本不同的方法。每个晶圆大小的芯片都直接在硅片上封装了 44 GB 的 SRAM。模型权重保留在芯片上,代币不间断地通过跨晶圆的模型层流动。这消除了低效的数据移动,这种数据移动会减慢基于 GPU 的推理速度,并可随模型大小平滑扩展,为未来前沿模型的持续速度优势铺平道路。

可用性和市场定位

目前,GPT-5.6 Sol on Ultrafast 模式仅向选定的一组客户提供有限预览,随着容量的增长,访问权限也会不断扩大。 Cerebras 将此次合作描述为推动下一波人工智能创新浪潮,并提高组织利用响应式人工智能实现目标的上限。

此次合作对于 Cerebras 来说是一个重要的里程碑,该公司长期以来一直致力于晶圆级计算,作为 GPU 主导的人工智能硬件市场的替代方案。通过直接与 OpenAI 合作来加速可用的最强大的前沿模型之一,Cerebras 有力地证明了其架构为高速推理工作负载提供了真正的竞争优势。

随着模型不断变得更大、更智能,实时服务的能力可能成为人工智能基础设施市场的决定性竞争因素。 Cerebras 与 OpenAI 的合作伙伴关系表明,推理速度的竞赛现在与模型智能的竞赛一样重要。

保持人工智能领先地位

了解更多 AI 硬件新闻、模型性能分析和行业动态,请添加书签 AI Buzz Wire

阅读更多人工智能新闻 →