Meta 的超级智能实验室发布了 Muse Glimmer,这是一个在 Apache 2.0 许可证下发布的 300 亿参数人工智能模型,旨在在消费级 GPU 上本地运行人工智能代理。这些权重可在 Hugging Face 上找到,这标志着该公司最新进军开放权重生态系统,该生态系统是首席执行官马克·扎克伯格 (Mark Zuckerberg) 在新发表的一篇关于人工智能未来的 6,500 字文章中所倡导的。

该版本发布之际,人工智能行业的更广泛覆盖 重塑了开发人员构建和部署智能系统的方式。 Meta 表示,开发人员可以使用 Muse Glimmer 进行本地编码、函数调用、自主代理和 LLM 作为法官评估任务,而无需将数据发送到云托管的 API。

专为设备上代理而构建

Meta 将 Muse Glimmer 定位为特定运营约束的解决方案:云托管模型需要持久的网络访问和中央基础设施,这可能会带来延迟、成本和隐私问题。相反,该公司将该模型推向需要设备上存在的工作负载,包括需要访问日程、消息、文件和其他私人上下文的个人代理。

该模型通过专用的感知编码器接受交错的文本和图像,允许代理将屏幕截图、图表和文档解释为对话的一部分。 Meta 报告称,这种多模式功能可以让代理推理可视化界面,这一功能对于构建与图形软件或网页交互的工具的团队来说非常重要。

Muse Glimmer 还支持 OpenClaw 和其他代理编排模式,模型的开发人员文档中详细介绍了自定义支架。基于该模型构建的本地编码代理可以决定它访问哪些存储库、终端、测试环境和命令,尽管 Meta 警告组织应该在衡量任务成功之前定义可用的命令和存储库。

与竞争对手的基准性能比较

Meta 的内部基准测试显示,Muse Glimmer 在 8 个通用代理基准测试中的 5 个上领先于 Google 的 Gemma4-31B 和阿里巴巴的 Qwen3.6-27B。在总代理得分上,Muse Glimmer 达到 74.6,而 Gemma4-31B 为 61.7,Qwen3.6-27B 为 71.1。

该模型在 WildClawBench 上的得分为 47.6,领先于 Gemma4-31B 的 37.6 和 Qwen3.6-27B 的 43.2。在通用人工智能助手的基准 GAIA2 上,Muse Glimmer 得分为 43.3,而竞争模型的得分为 36.4 和 40.0。 OSWorld-Verified 测试代理在真实计算机环境中运行的能力,得出了该组中最大的差距:Muse Glimmer 达到了 65.9,而 Gemma4-31B 为 58.5。

并非所有类别都青睐 Meta 的模型。在 SkillsBench 上,Qwen3.6-27B 得分为 46.6,Muse Glimmer 得分为 44.3。 Qwen3.6-27B 在 GDPval-AA 上也以 1,141 领先,而 Muse Glimmer 则为 953。

编码结果显示竞争格局

Muse Glimmer 的编码基准呈现出更狭窄的竞争图景。该模型以 51.2 分领先 SWE-Bench Pro,而 Gemma4-31B 为 36.9 分,Qwen3.6-27B 为 50.2 分。然而,Qwen3.6-27B 在 SWE-Bench Verified 上以 77.2 的成绩领先于 Muse Glimmer 的 76.0,并在 TerminalBench 2.1 上以 60.7 领先于 Muse Glimmer 的 51.7。

Meta 提供的材料还描述了对失败的工具调用进行重试训练,这种行为使代理能够自动从错误中恢复。该公司指出,此功能需要对重复尝试进行控制,特别是在工具可以更改源代码或调用外部系统的情况下。

扎克伯格的开放重量愿景

Muse Glimmer 的发布恰逢扎克伯格发表了一篇长文,阐述了他对人工智能发展的愿景。据路透社和彭博社报道,Meta 首席执行官利用这篇文章来支持开放权重方法,认为广泛可用的模型可以防止人工智能权力集中在少数公司手中。

据报道,扎克伯格警告单一实体控制超级智能系统的风险,并表示不存在单一仁慈的超级智能。这些言论将 Meta 的开放权重策略定位为一种技术理念,也是针对 OpenAI 和 Anthropic 等封闭模型竞争对手的竞争立场。

《纽约时报》将 Muse Glimmer 描述为 Meta 人工智能功能的开源版本,消费者可以在家中使用,而《华尔街日报》指出,这篇文章代表了扎克伯格迄今为止对其人工智能世界观最详细的阐述。

团队的实际考虑因素

Meta 的基准测试展示了标准化测试的性能,但它们没有显示组织将本地代理连接到自己的文件、日历、消息传递系统或内部工具后的行为方式。该公司承认,屏幕截图读取模型可以解释他们所看到的内容,但本地测试仍然必须涵盖权限、显示布局、文档格式以及连接工具返回的错误。

对于评估 Muse Glimmer 的组织,Meta 建议在部署之前定义代理可用的命令和存储库。该模型的安全相关评估包括 CI Memories 和 Siren AgentDojo 测试,尽管该公司对每种测试使用不同的措施。

该版本的发布使 Meta 在开放重量领域与谷歌的 Gemma 系列和阿里巴巴的 Qwen 模型直接竞争。借助允许商业使用的 Apache 2.0 许可证,Muse Glimmer 可以加速那些需要代理功能的开发人员的采用,而无需承担云 API 的经常性成本和隐私权衡。

保持人工智能领先地位

有关 AI 模型、开放权重版本以及塑造行业的竞争动态的最新发展,请访问 AI Buzz Wire 进行全面报道。

阅读更多人工智能新闻 →