Cerebras 已将 Qwen 3.8 27B 添加到其 Cerebras Inference 平台的公共端点,根据该公司的模型目录文档,开放权重模型以每秒大约 1,500 个代币的速度运行。此次上市使得阿里巴巴使用最广泛的开放模型系列之一的速度使典型的 GPU 托管服务相形见绌。

该公告立即引起了开发人员的关注:该故事在一天之内就在 Hacker News 上获得了 600 多个点,其关注度反映了对快速、廉价推理的需求有多热。为了更广泛地了解推理市场,人工智能突发新闻 柜台会跟踪每一个主要平台的更新。

目录上的规格

根据 Cerebras 的文档,Qwen 3.8 27B 携带 270 亿个参数,并支持免费层上的 64K 上下文令牌和付费层上的 128K 上下文令牌,以每秒约 1,500 个令牌的速度运行。它与 OpenAI 的开放权重 GPT-OSS 120B 模型并驾齐驱,该模型在同一目录中以每秒大约 3,000 个代币的速度列出,免费层有 65K 上下文,付费层有 131K 上下文。

这两种模型均可在 Cerebras 的免费试用和即用即付级别上使用,但受费率限制。需要预留容量、更高吞吐量或生产 SLA 的客户可直接使用该公司的专用端点产品,该文档还将其列为通往公共端点上的两个模型系列之外的其他模型系列的途径。

上下文窗口与速度数据一起值得关注。免费层的 64,000 个代币和付费层的 128,000 个代币足以在内存中同时保存大量代码库、长文档或扩展代理记录,这对于快速解码带来回报的确切工作负载很重要。 Cerebras 的文档还包括 OpenAI 兼容性指南,降低了现有代码已针对 OpenAI SDK 的团队的切换成本:原则上,将现有客户端指向 Cerebras 端点是配置更改而不是重写。

未剪枝模型,透明压缩

文档中值得注意的一个细节是 Cerebras 公开了它如何处理模型压缩。该公司表示,其公共端点上的所有模型都是原始的、未经修剪的版本,并且仅在存储期间使用选择性仅权重量化以保持质量。敏感层保持完全精度,激活、注意力和 KV 缓存保持未量化,并且反量化是动态发生的。

Cerebras 还公开了其对修剪技术的研究,例如 REAP(路由器加权专家激活修剪):修剪后的变体在 Hugging Face 上与研究社区共享,但不通过公共 API 提供。对于选择在何处运行开放模型的开发人员来说,所服务的内容的透明度异常明确。

为什么代币速度很重要

像这样的吞吐量数字对于代理和编码工作负载来说最为重要。链接数百个模型调用的应用程序(编码代理、自主工作流程、实时助手)会在每个步骤中增加每个令牌的延迟,因此每秒 50 个令牌和 1,500 个令牌之间的差异会产生本质上不同的体验。流式传输长时间完成的交互式应用程序受益最明显。

权衡是范围。 270 亿个参数的模型在最困难的推理任务上无法与前沿系统相匹配,而 Cerebras 自己的文档将繁重的生产工作负载转向专用容量。但对于中等规模的开放模型已经足够好的大型中间任务——摘要、分类、工具使用、代码编辑——速度就成为了差异化因素。

开发商还会权衡价格因素。公共端点模型可以在做出任何承诺之前进行免费试用,这使得针对团队自己的工作负载进行基准测试基本上没有摩擦——这是一个故意的入口,与需要在提供第一个代币之前进行销售对话的企业合同形成鲜明对比。记录的速率限制是需要注意的约束:免费层访问的存在是为了证明速度,而不是运行生产流量。

开放模型的繁忙延伸

这一补充是在开放重量级人工智能的拥挤阶段出现的。阿联酋实验室 IFM 刚刚推出了 K2 Horizo​​n,这是一个由六个完全开放模型组成的互联车队,Meta 继续迭代其 Muse 系列以进行编码和代理使用。与此同时,中国开放模式生态系统的快速发展,压缩了整个行业的发布周期。

对于开发人员来说,实际的收获是开放模型堆栈在两个方面同时成熟:功能,因为中型模型在日常任务上缩小了与旗舰模型的差距;服务经济性,因为专业推理提供商在原始速度上竞争。 Cerebras 上的 Qwen 3.8 27B 是这两种趋势的数据点——当前一代的开放模型在专为该工作而构建的硬件上以一年前的速度运行。

评估平台的开发人员应该对自己的工作负载进行基准测试:发布的速度是目录数字,实际吞吐量取决于提示长度、并发性和配置,并且免费层的速率限制将在其速度之前绑定。

保持人工智能领先地位

每次模型发布、推理平台更新和开发人员工具启动都会实时跟踪 - 阅读更多人工智能新闻 →