アマゾン ウェブ サービスは、Zhipu AI としても知られるモデル開発者である Z.ai の GLM 5.3 を Amazon Bedrock に追加し、企業顧客に今年リリースされた最大のオープンウェイト モデルの 1 つへのフルマネージド API アクセスを提供します。 10 月 5 日に AWS Machine Learning ブログで発表されたこの開始により、企業が重みを自己ホストする必要がなく、Bedrock のマネージドインフラストラクチャを通じて 753B パラメータの専門家混合モデルが利用できるようになります。

AWS によると、Hugging Face Hub で公開されている GLM 5.3 はコーディングと長期的なエージェント タスクに最適化されており、Z.ai は注目すべきサイバーセキュリティ機能を報告しています。これらの強みは、エンタープライズバイヤーが今年フロンティア API から引き出しているもの、つまりマルチステップの推論、ツールで強化されたワークフロー、大規模なコードベースにわたる持続的なコンテキストに直接対応しています。 この件の詳細は、人工知能の最新情報をご覧ください。

Bedrock の顧客が実際に得られるもの

この統合は、Bedrock の標準のマネージド アクセス プレイブックに従い、エンタープライズ グレードの追加機能がいくつか追加されています。

  • 柔軟な API アクセス。 GLM 5.3 は、ネイティブの Bedrock Invoke API および Converse API だけでなく、OpenAI 互換の Responses API および Chat Completions API (AWS が新しいアプリケーションに推奨する API) を通じて呼び出すことができます。既存の OpenAI ベースのパイプラインを移行するチームは、最小限のコード変更でモデルを再ターゲットできます。
  • クロスリージョン推論 モデルは、米国のクロスリージョン トラフィック用の us.zai.glm-5.3 とグローバル ルーティング用の global.zai.glm-5.3 という 2 つの推論プロファイルの背後に組み込まれています。リクエストは顧客が選択したソース リージョンに送信され、Bedrock が安全なルーティングを処理します。
  • プロンプト キャッシュ。 暗黙的な自動キャッシュはデフォルトでオンになっており、OpenAI 互換 API で明示的なキャッシュ制御が利用可能です。毎ターン大規模なシステム プロンプトやリポジトリ コンテキストを再送信するエージェント ワークロードの場合、AWS はキャッシュによってレイテンシと入力コストの両方が削減されると述べています。
  • サービス レベル お客様は、コストが最適化され、時間にあまり依存しないワークロードには Flex、レイテンシー クリティカルなトラフィックにはプレミアムを設定した Priority、またはデフォルトのバランスには Standard を選択できます。

1 つの注意点が際立っています。AWS は、Bedrock 上の GLM 5.3 へのアクセスは資格のある企業顧客が利用できると述べており、すべてのアカウントに対してオープンなセルフサービスではなく、ゲート付きオンボーディング プロセスを提案しています。

中国の研究所にとって初の収益分配

技術的な統合を超えて、この発表に関する報道では、AWS と Z.ai の間の使用量ベースの収益分配協定が説明されており、モデルプロバイダーは Bedrock の消費の一部を得ることができます。これは、Bedrock が西側のパートナーと使用している標準商用テンプレートであり、現在は辺境の中国の研究所の主力モデルに適用されています。香港市場に関する金融報道各社は、このニュースを受けて芝浦関連株が序盤の取引で7%以上上昇したと伝えた。

この契約は、プラットフォーム戦略について何を示すかという点で重要だ。ハイパースケーラーは過去 2 年間、欧米の研究機関との排他的感情を持った提携を固守することに費やした。 Bedrock を中国のオープンウェイトファミリーに開放することで、コストに敏感な企業や米国モデルが価格圧力に直面している市場にもプラットフォームのリーチが広がります。また、Z.ai ディストリビューションには、これに匹敵するオープンウェイト リリースがありません。753B パラメータ チェックポイントを決してダウンロードしない何千もの企業が、SLA の背後でそれを呼び出すことができるようになりました。

オープンウェイトからマネージド API まで

GLM 5.3 の Bedrock への道は、無差別級コミュニティを駆け抜けました。このモデルは Hugging Face Hub で公開され、マネージド ホスティングが提供される前に、その重み、ベンチマーク、ライセンス条項が開発者の注目を集めました。このプレイブックは、Z.ai が中国製チップで動作する MIT ライセンスの GLM-5.3-Flash リリースを含む GLM シリーズ全体で使用してきました。

企業にとって、重みのダウンロードと API の呼び出しの間の計算は、常に運用に帰着します。753B パラメータの専門家混合モデルをセルフホスティングするには、ほとんどの組織が単一のワークロードに対して正当化できない重大な GPU 容量と MLOps の成熟度が必要です。 Bedrock のマネージド アクセスはその障壁を取り除き、データ常駐の制約がある企業にハイブリッド展開の選択肢を残したままにします。

具体的に始める

AWS のドキュメントでは、Bedrock コンソール (コードを必要とせずにプロンプ​​ト テストを行うための標準プレイグラウンドにモデルが表示されます) からの呼び出しと、Bedrock ランタイム エンドポイントを介したプログラムによる呼び出しについて説明しています。前提条件は、bedrock:InvokeModel や bedrock:InvokeModelWithResponseStream などのモデル呼び出しの通常の IAM 権限に加え、選択したクロスリージョン推論プロファイルの権限です。コード例には Python 3.10 以降がリストされています。

注目すべきは、AWS の投稿には、Docker とオープンソースの Strix ツールで構築されたオプションのセキュリティ テスト デモが含まれており、攻撃的なセキュリティのワークフローのために Bedrock 経由で GLM 5.3 を実行することです。これは、Z.ai がこのモデルについて主張しているサイバーセキュリティの位置付けを強調する珍しい内容です。 AWS のようにコンプライアンスに敏感なプラットフォームにとって、ハッキング デモの文脈で中国のモデルを紹介することは、Z.ai が追い求めているワークロードの組み合わせについての鋭いシグナルとなります。

専門家の混合の経済学

753B のパラメータの数値は、そのサイズよりもそのアーキテクチャが重要です。専門家混合モデルは、トークンごとにパラメーターの一部のみをアクティブにします。これにより、GLM 5.3 は、リクエストごとにフロンティア スケールの推論コストを発生させることなく、フロンティア スケールの機能を提供できるようになります。プロンプト キャッシュ (繰り返しのシステム プロンプトとリポジトリ コンテキストが低コストでキャッシュから提供される) と組み合わせることで、経済性は、今年のエンタープライズ AI 予算の大半を占める大量のエージェント ワークロード (コーディング アシスタント、セキュリティ オペレーション、および長時間実行される自動化パイプライン) に直接向けられます。

Bedrock のサービス層を使用すると、運用チームはコストとワークロードごとのレイテンシをトレードできるようになります。夜間のバッチ コード分析ジョブは Flex 価格で実行できますが、インタラクティブなセキュリティ コパイロットは優先レベル (同じモデルで異なる測定方法) で実行されます。

何を見るか

この打ち上げにより、3 つの短期テストが設定されます。まず、採用です。Bedrock のエンタープライズ ベースが GLM 5.3 を運用オプションとして扱うか、ベンチマークの対象として扱うかどうかです。第 2 に、価格設定です。Flex 層は遅延を最適化したサービス レベルを引き下げており、GLM シリーズの価格設定は歴史的に西側の競合他社にコストの面で圧力をかけてきました。第三に、他のハイパースケーラーも、中国モデルのエンタープライズセグメントをホストするか譲渡するかという同じ選択に直面しています。

モデルの可用性を追跡している AI チームにとって、実際に得られることは簡単です。2026 年に最も注目されているオープンウェイト モデルの 1 つが、AWS の顧客にとって 1 回の API コールで利用できるようになり、AI モデルの状況は、中国のラボと契約するすべてのプラットフォームとの間で競争力が高まっています。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →