Nvidia 支持的美国初创公司 Reflection AI 于 10 月 5 日推出了其首个开放权重模型,这是一个名为 Beam 的稀疏专家混合系统,该公司将其定位为对目前由中国实验室主导的开放权重前沿领域迄今为止最强大的西方挑战。该公告发布在 Reflection 自己的博客上,并很快被路透社、TechCrunch、财富和 Semafor 转载,但它的发布有一个转折:该模型尚无法下载。
Beam 正在接受该公司所说的最终红队和评估。早期访问是通过注册过程开放的,Reflection 表示它将在本月晚些时候发布权重、技术报告、模型卡和开发人员工件。当这种情况发生时,Beam 将成为美国实验室有史以来发布的最大的开放权重版本之一,也是对美国公司是否能够匹配发布节奏和开放性的最明确的测试,正是这种节奏和开放性使中国模型成为许多开源社区的默认选择。如需持续报道自由重量比赛和赛场上的其他一切动态,请为我们的人工智能新闻主页添加书签。
Beam 背后的数字
Beam 是一个稀疏的专家混合模型,共有 5010 亿个参数,其中每个代币大约有 230 亿个参数处于活跃状态。 Reflection 表示,它使用从网络和专有许可数据集中提取的 23.8 万亿个代币对模型进行了预训练,并声称基础模型匹配或优于类似规模的开放基础模型。
更独特的主张涉及强化学习。 Reflection 构建了算法、训练环境和基础设施来维持大规模的高计算 RL,该公司报告称,在四个星期的训练中,其 RL 运行在 10,500 个 NVIDIA GB300 GPU 上生成了超过 1 亿次部署。对于开放权重版本来说,这是一笔异常大的 RL 投资,Reflection 将其归功于 Beam 的竞争性能及其所谓的前沿推理计算效率。
基准:有竞争力,但尚未领先
Reflection发布的基准表将Beam稳稳地置于开放重量组中,落后于最大的中国型号,但领先于或与几个知名品牌持平。
在 SWE-Bench Pro v2-Hard 上,Beam 得分为 77.2,落后于同排的 GLM 5.3(88.2)和 Kimi K3(88.2),但远远领先于 Inkling(56.9)。在 SWE-Bench Pro v1 上,Beam 得分为 65.5,领先于 Inkling (54.3)、Nemotron 3 Ultra (46.4) 和 GLM 5.2 (62.1),而 Qwen 3.8-Max 得分为 67.7。在 DeepSWE v1.1 代理编码基准测试中,Beam 记录为 44.4,与 GLM 5.2 的 44.0 持平,落后于 GLM 5.3 (61.0)、Qwen 3.8-Max (51.0) 和 DeepSeek V4.1 Flash (74.2)。
该公司自己的框架对 Beam 的立场很坦率。 Reflection 在博客文章中写道,Beam“推进了西方开放权重前沿”,并且“与 GLM 5.2 等大型开放模型具有竞争力,并且在编码和代理任务方面接近 Qwen 3.8-Max”。它还承认像 Kimi K3 这样的前沿开放模型“在原始能力上保持领先”。
有两个警告值得强调。首先,这里的每个数字都是Reflection在权重发布前自行报告的,只有在技术报告和检查点公开后才能进行独立验证。其次,该公司自己的表格中的几个单元格被标记为未报告,这使得目前无法进行完整的同类比较。
效率论证
Reflection 认为 Beam 的真正优势不是原始排行榜位置,而是推理时间的成本。由于每个代币的 5010 亿个参数中只有 230 亿个参数被激活,该公司认为 Beam 可以提供接近前沿的代理和编码性能,而其计算成本只是较大密集模型的一小部分。这种定位反映了中国开放式家庭如此受初创公司欢迎的策略:足够强大的能力和价格,使永远在线的代理商在经济上可行。
如果效率声明能够通过独立基准测试,那么它可能比排行榜增量更重要。运行数千个并行编码代理的团队更关心每个完成任务的成本,而不是个位数的基准点。
地缘政治暗流
对于开源模型的发布来说,此次发布的报道具有惊人的地缘政治意义。路透社将 Beam 描述为 Reflection 的“第一个人工智能模型”,旨在“挑战中国开放模型”。 《财富》杂志询问 Beam 是否会成为“美国与中国竞争的最佳机会”,Semafor 将该公司描述为“对中国实验室的开源西方回应”。
这一框架反映了 2026 年底开放权重生态系统的状况:最有能力的可下载模型绝大多数来自中国实验室,包括 Z.ai 的 GLM 系列、Moonshot 的 Kimi 系列、阿里巴巴的 Qwen 和 DeepSeek。美国实验室基本上关闭了他们的最佳权重,转而押注于 API 收入。 Reflection 则押注相反:开放的西方前沿模式可以吸引开发者生态系统,而 Nvidia 的支持为其提供了跟上的计算跑道。
接下来会发生什么
本月晚些时候发布的权重将回答一些重要问题:Beam 在 Reflection 自己的评估之外表现如何,权重附带什么许可证,以及在独立负载下效率是否保持不变。在那之前,Beam 仍然是一个有前途的基准表、一个注册表单,以及美国实验室今年做出的最重要的开放权重承诺。
对于决定是在 GLM、Kimi、Qwen 上标准化还是等待 Beam 的开发人员来说,实用的建议是在技术报告和第三方评估落地之前保留最终决定。公开重量级比赛有一位新的美国参赛者,而且这是一段时间以来第一次,它不是从后面开始的。
保持人工智能领先地位
开放重量前沿每周都会变化,实验室的发布速度比任何人都可以跟踪的要快。 在 AI Buzz Wire 上阅读更多人工智能新闻,了解模型发布、基准细分及其背后的商业故事。
在这里探索最新的人工智能发展。