Cerebras 揭开了 CS-4 的面纱,这是一款围绕其新型 WSE-3 Turbo 晶圆级处理器构建的机架级 AI 推理系统,声称该机器的推理速度比基于 GPU 的系统快 30 倍,因为该公司将自己定位为 Nvidia 数据中心帝国的速度替代品。
此次发布于周二宣布,并在公司产品页面上进行了详细介绍,并受到了路透社、彭博社和 The Register 的大量报道,标志着 Cerebras 自上市以来最重大的硬件更新,对于一家自 IPO 以来股价一直陷入困境的公司来说,这是一个关键时刻。投资者似乎正在关注:Cerebras (CBRS) 的股价因这一消息而飙升,投资者商业日报援引首席执行官的评论称人工智能推理市场“增长如此之快”。
对于关注人工智能模型响应速度加快的竞赛的读者来说,CS-4 的发布是本季度最重要的硬件故事之一,它发生在人工智能行业覆盖面发生更广泛变化的背景下,这些变化继续重塑计算格局。
CS-4 内部有什么
主要部件是 WSE-3 Turbo,它是 Cerebras 餐盘大小的晶圆级发动机的升级版。根据 The Register 的技术深入研究,WSE-3T 并不是新芯片——它保留了与两年前的 WSE-3 相同的台积电 5nm 工艺、46,225 平方毫米芯片面积、4 万亿个晶体管、900,000 个内核和 44 GB 晶圆上 SRAM。
相反,Cerebras 通过更加努力地推动现有芯片,实现了性能翻倍。 WSE-3T 将稀疏 FP16 计算能力加倍至 250 petaFLOPS,将密集 FP16 性能加倍至估计 25 petaFLOPS,将内存带宽加倍至每秒 43.2 拍字节,并将 I/O 带宽加倍至每秒 2.4 太比特。据 The Register 估计,该公司目前的硅时钟频率约为 2.8 GHz,高于上一代的约 1.4 GHz。
根据 Cerebras 的说法,诀窍在于重新设计的电力传输系统,该系统距离处理器仅 0.5 毫米,比传统 GPU 板的典型距离约 50 毫米近大约 100 倍。这种接近几乎消除了板级功耗,并允许两倍的功率到达晶圆,从而在更快的令牌生成背后实现更高的工作频率。
Nexus 机架架构
除了芯片本身之外,CS-4 还引入了 Cerebras 所称的 Nexus 平台架构,这是其第一个真正的机架规模设计,也是对 Nvidia 的 NVL72 和 AMD 的 Helios 机架系统的直接回应。每个 CS-4 最多可携带三个 WSE-3T 处理器,这些处理器安装在独立的“晶圆级背包”中,这是一种 3D 封装,可将晶圆、电源转换、直接液体冷却、高速 I/O 和控制电子器件折叠到单个组件中,而组件数量减少了 50%。
模块化设计将稳定的电源、冷却和网络层与计算分开。 Cerebras PowerRack 可以在任何计算到达之前安装并进行设施认证,然后背包滑入到位,从而将部署时间从几天缩短到几小时,据该公司称。
功耗很大。 The Register 估计每个背包的功率约为 46 kW,系统总功率为 120 至 140 kW——这个数字引人注目,但与 AMD 和 Nvidia 预计今年晚些时候推出的 240 至 250 kW 机架系统相比显得保守。
杀死 Switch
也许技术上最有趣的选择是互连。 Cerebras 没有通过交换机路由晶圆到晶圆的流量(AWS 在其 Trainium3 加速器中采用的方法),而是将其芯片连接到 2D 环面拓扑中,其中相邻晶圆直接相互通信。该设计将晶圆到晶圆的延迟从 5 微秒缩短至仅 2 微秒,Cerebras 表示该网格可以支持多达 50 万亿个参数的模型,远远超出了目前存在的任何模型。
速度结果是惊人的。在单个 CS-4 系统上,基准测试公司 Artificial Analysis 在 gpt-oss-120b 上测量到每个用户每秒最多 4,400 个令牌,大约是目前最快的基于 GPU 的推理服务每秒约 350 个令牌的 12 倍。 Cerebras 还声称,该系统在超过 10 万亿个参数的模型上每秒支持超过 1,000 个代币。
分解的合作伙伴战略
值得注意的是,Cerebras 不再尝试在自己的芯片上运行整个推理管道。该公司已与 AWS 和 AMD 合作,将计算密集型的即时推理处理阶段分别转移到 Trainium XPU 和 Instinct GPU 上,让其晶圆级引擎来处理延迟敏感的解码阶段,而这正是其大量 SRAM 储备发挥作用的地方。
CS-4 的发布还扩展了 Cerebras 与 OpenAI 的合作。雅虎财经报道称,此次揭幕仪式与 OpenAI 和 AMD 的新合作伙伴关系旨在加速 AI 推理——建立在公司 8 月初推出的超快模式的基础上,该模式以每秒高达 750 个代币的速度向用户提供 GPT-5.6 Sol。
标题数字背后的警告
行业分析师敦促人们对营销数据保持谨慎。 The Register 指出,Cerebras 的标题 250 petaFLOPS 依赖于稀疏性,这通常不利于大型语言模型推理,并且峰值内存带宽数字很大程度上是理论上的,因为 WSE-3 缺乏使自己的 SRAM 饱和的计算能力。该出版物还质疑为什么 Cerebras 将性能提高了一倍,而不是增加 SRAM 容量,自五年前推出 WSE-2 以来,SRAM 容量并没有显着增长——在解码加速器从内存中获益最多的分类推理时代,这是一个奇怪的选择。
尽管如此,市场机会是真实存在的。由于人工智能聊天机器人和代理需要更快的响应时间,推理速度已成为真正的竞争优势,Cerebras 现在已经证明它可以以商业节奏迭代其非常规晶圆级技术。
首批 CS-4 将于本季度开始发货,首批系统预计在 9 月底前上线。这是否足以削弱英伟达的主导地位还有待观察——但业界最快的人工智能推理在一段时间以来第一次有了新的地址。
保持人工智能领先地位
CS-4 等硬件的发布推动了市场并重新定义了人工智能系统的功能。 阅读更多人工智能新闻,跟上每一个发展。
探索最新的人工智能报道 →