Amazon Web Services 已将来自模型开发商 Z.ai(也称为zhipu AI)的 GLM 5.3 添加到 Amazon Bedrock,为企业客户提供对今年发布的最大开放权重模型之一的完全托管 API 访问。此次发布于 10 月 5 日在 AWS 机器学习博客上宣布,使 753B 参数混合专家模型可以通过 Bedrock 的托管基础设施使用,而不是要求公司自行托管权重。
根据 AWS 的说法,在 Hugging Face Hub 上发布的 GLM 5.3 针对编码和长期代理任务进行了优化,Z.ai 报告了显着的网络安全功能。这些优势直接反映了企业买家今年从前沿 API 中获取的内容:多步骤推理、工具增强的工作流程以及跨大型代码库的持续上下文。 更多相关背景,请参阅我们的人工智能资讯。
Bedrock 客户实际得到什么
该集成遵循 Bedrock 的标准托管访问手册,并具有一些企业级附加功能:
- 灵活的 API 访问。 GLM 5.3 可以通过 OpenAI 兼容的响应和聊天完成 API(AWS 建议新应用程序使用)以及本机 Bedrock Invoke 和 Converse API 来调用。迁移现有基于 OpenAI 的管道的团队可以通过最少的代码更改来重新定位模型。
- 跨区域推理。 该模型支持两个推理配置文件:用于美国跨区域流量的 us.zai.glm-5.3 和用于全球路由的 global.zai.glm-5.3。请求发送到客户选择的源区域,并且 Bedrock 处理安全路由。
- 提示缓存。 默认情况下,隐式自动缓存处于启用状态,并且 OpenAI 兼容 API 上提供显式缓存控制。 AWS 表示,对于每次都会重新发送大型系统提示或存储库上下文的代理工作负载,缓存可以减少延迟和输入成本。
- 服务等级。 客户可以选择 Flex 来实现成本优化、时间敏感度较低的工作负载,选择 Priority 来实现延迟关键型流量,或者选择 Standard 来实现默认平衡。
需要注意的是:AWS 声明,符合条件的企业客户可以访问 Bedrock 上的 GLM 5.3,这建议采用封闭式的入职流程,而不是为所有账户开放自助服务。
中国实验室首次收入共享
除了技术集成之外,媒体对此次发布的报道还描述了 AWS 和 Z.ai 之间基于使用情况的收入共享安排,根据该安排,模型提供商可以从 Bedrock 消费中获得分成——这是 Bedrock 与西方合作伙伴使用的标准商业模板,现在已应用于中国前沿实验室的旗舰模型。香港市场财经媒体报道称,受此消息影响,智浦相关股价早盘上涨逾 7%。
这笔交易很重要,因为它传达了平台战略的信号。过去两年,超大规模企业与西方实验室建立了排他性联盟;向中国开放重量系列开放 Bedrock 扩大了该平台对成本敏感的企业以及美国车型面临定价压力的市场的影响力。它还为 Z.ai 发行版提供了任何开放权重发行版都无法比拟的:成千上万永远不会下载 753B 参数检查点的企业现在可以在 SLA 后面调用它。
从开放权重到托管 API
GLM 5.3 通往 Bedrock 的道路贯穿了开放权重社区。该模型发布在 Hugging Face Hub 上,其权重、基准测试和许可条款在提供任何托管托管之前就引起了开发人员的关注——Z.ai 在 GLM 系列中使用了该剧本,包括在中国制造的芯片上运行的 MIT 许可的 GLM-5.3-Flash 版本。
对于企业来说,下载权重和调用 API 之间的计算始终归结为操作:自托管 753B 参数混合专家模型需要强大的 GPU 容量和 MLOps 成熟度,而大多数组织无法证明单个工作负载的合理性。 Bedrock 的托管访问消除了这一障碍,同时为具有数据驻留限制的公司保留了混合部署的选择。
具体开始
AWS 的文档介绍了从 Bedrock 控制台进行的调用(模型出现在标准操场中,无需任何代码即可进行快速测试),并以编程方式通过 bedrock 运行时端点进行调用。先决条件是模型调用的常用 IAM 权限,包括 bedrock:InvokeModel 和 bedrock:InvokeModelWithResponseStream,以及所选跨区域推理配置文件的权限。代码示例中列出了 Python 3.10 或更高版本。
值得注意的是,AWS 帖子包括一个使用 Docker 和开源 Strix 工具构建的可选安全测试演示,通过 Bedrock 运行 GLM 5.3 以实现攻击性安全工作流程——这一不寻常的内容强调了 Z.ai 对该模型所声称的网络安全定位。对于像 AWS 这样对合规性敏感的平台,在黑客演示环境中展示中国模型是 Z.ai 所追求的工作负载组合的明确信号。
专家混合经济学
753B 的参数数字与其说是其尺寸,不如说是其架构。混合专家模型仅激活每个令牌的一小部分参数,这就是 GLM 5.3 如何提供前沿规模的功能,而无需对每个请求产生前沿规模的推理成本。结合提示缓存(以较低的成本从缓存中提供重复的系统提示和存储库上下文),其经济性直接针对今年主导企业人工智能预算的大量代理工作负载:编码助理、安全操作和长期运行的自动化管道。
然后,Bedrock 的服务层让运营团队可以在成本与每个工作负载的延迟之间进行权衡。每晚批量代码分析作业可以按 Flex 定价运行,而交互式安全副驾驶则采用优先级 — 相同的模型,但计量方式不同。
看什么
此次发射设置了三项近期测试。首先,采用情况:Bedrock 的企业基础是否将 GLM 5.3 视为生产选项或基准测试好奇心。其次,定价:Flex 层削弱了延迟优化的服务水平,而 GLM 系列的定价历来给西方竞争对手带来了成本压力。第三,回应:其他超大规模企业也面临着同样的选择,是托管还是割让中国模式的企业细分市场。
对于跟踪模型可用性的 AI 团队来说,实际的收获很简单 - 2026 年最受关注的开放权重模型之一现在可供 AWS 客户进行 API 调用,并且随着每个与中国实验室签约的平台的出现,AI 模型的竞争变得更加激烈。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →