Zhipuとしても知られる北京に本拠を置く人工知能企業Z.aiは、同社の主力モデルの新しいバージョンであるGLM-5.3をリリースした。同社によれば、これはソフトウェアエンジニアリングにおいてこれまでで最も有能なオープンウェイトシステムであり、予想外に恐るべきサイバーセキュリティスキルを開発したシステムであるという。 8 月 14 日に発表され、同社のブログ投稿で詳細が説明されている GLM-5.3 は、6 月にリリースされた前世代の GLM-5.2 と同じ約 7,000 億パラメータのベース モデルに基づいて構築されています。同社によれば、すべての改善は大規模な基盤ではなく、トレーニング後のものであるという。このリリースは、Anthropic や OpenAI のクローズド システムに勝つことを目的とした中国のオープンウェイト モデルの波の最新版です。 AI Buzz Wire モデル トラッカーにとって、GLM-5.3 は、オープンウェイト フロンティアが多くの予想よりも早くコーディング ギャップを埋めつつあることを示す明確なシグナルです。
トレーニング後に得られる利益
Z.ai は GLM-5.3 でのアプローチについて率直に「トレーニング後のスケーリングだけが私たちがやったことです」と述べています。同社は、GLM-5.2 で導入した強化学習スタックを引き継ぎました。これには、効率的な長いコンテキスト処理のための IndexShare、長期タスクでの強化学習のための SAO、および大規模な非同期トレーニングのための Slime と呼ばれるオープンソース フレームワークが含まれます。過去 1 か月間で、より多くの環境、より多様なタスク、およびより多くのコンピューティングをそのスタックに注ぎ込んだだけです。
その成果はコーディング ベンチマーク全体に現れます。 Terminal Bench 3.0 では、GLM-5.3 は GLM-5.2 のスコア 4.6 から 28.3 にジャンプし、6 倍以上の改善を実現しました。 Terminal Bench 3.0 とエージェントの最終試験に関するオープンソースの最先端の結果が掲載され、エージェント能力の ALE-CLI 測定値が 23.8 から 28.5 に向上しました。 Z.ai は、社内の Z.ai コード ベンチで GLM-5.2 と比較して 50% の改善を報告しています。Z.ai コード ベンチは、現実的な開発環境でコーディング エージェントを評価し、公開テスト セットからの汚染のリスクを軽減するように設計されたプライベート ベンチマークです。
重要なのは、結果が向上するだけでなく、トークン効率の向上によって利益が得られることです。高労力では、GLM-5.3 はタスクあたり約 50,000 出力トークンで社内ベンチマークで 31.4% の完了率に達し、Z.ai によれば、これは 120,000 トークンで Anthropic の Claude Opus 4.8 の 29.5% を上回ります。 GLM-5.3 は、最大努力で 39.5% に達する Anthropic のより高度な Claude Fable 5 に依然として及んでいません。
サイバー能力の予期せぬ飛躍
GLM-5.3 の最も顕著な結果は、コーディングではなくセキュリティにあります。 Z.ai はトレーニング後のスケールを調整し、脆弱性発見データと環境をトレーニング ミックスに導入することで、モデルの欠陥の発見と推論が向上すると期待していました。チームが驚いたのは、その能力がいかに早く開発されたかということでした。
GLM-5.3 は、単に孤立したバグを発見する能力が向上しただけではありません。悪用の複数の段階にわたって推論を開始し、完全な攻撃チェーンのための一貫した計画を形成しました。モデルがホワイトボックス ソース コードから脆弱性を特定して検証できるかどうかをテストするベンチマークである CyberGym では、GLM-5.3 のスコアは 84.5% で、GLM-5.2 の 77.2% から上昇しました。これは、Mythos 5 の 83.8%、GPT-5.6 Sol の 83.6% を上回り、ベンチマークで最高の結果です。実際の脆弱性とその悪用について、より深い推論を要求する ExploitBench では、GLM-5.3 は GLM-5.2 のスコアを 2 倍以上上回り、54.4% に達しました。ただし、依然として Mythos 5 の 78.0% や GPT-5.6 Sol の 76.5% には大きく及んでいません。
Z.ai は一貫したパターンを観察しています。つまり、ベンチマークが利用チェーンの上位にあるほど、GLM-5.2 に対する利益が大きくなり、閉じられたフロンティアまでの残りの差も大きくなります。 「当社が最も遅れている地域で、能力は最も急速に成長している」と同社は述べています。
現実世界の脆弱性の発見
サイバースキルはベンチマークに限定されません。 Z.ai の報告によると、GLM-5.2 以来、中国のいくつかのセキュリティ チームと協力してモデルを現実世界のコードベースに対してテストしてきました。専門家によるレビュー、スクリーニング、重複排除の後、モデルは 269 のプロジェクトにわたって 2,436 件の脆弱性を特定し、その中には 1,097 件の中から高の重大度の問題が含まれていました。調査結果は、システム カーネル、オペレーティング システム、ブラウザ エンジン、オープンソース インフラストラクチャ、Web アプリケーション、およびネットワーク プロトコルに及び、その多くは何年も、あるいは何十年も気づかれなかったもので、最も古いものは約 40 年前に遡ります。
これらの結果は、Anthropic が独自のマルチエージェント セキュリティ研究で説明した、調整されたエージェントの群れを使用してオープンソース ソフトウェアの脆弱性を大規模に探索した研究を反映しています。
オープンウェイト — 遅延あり
Z.aiは、安全性評価と硬化が完了したら、GLM-5.3ウェイトを2週間以内にリリースすると述べている。この意図的な遅延は、発表全体に流れる緊張を反映している。作成者の予想よりも早く強力な攻撃的なサイバー能力を開発するモデルは、まさに責任ある解放について疑問を引き起こす種類のシステムである。同社は、トレーニングとロールアウトの一貫性が高い数値精度まで改善され、スケーリングにおける困難の多くがモデル自体から現実的で検証可能なタスク環境の設計に移行したことを強調しています。
競合状況は明らかです。 GLM-5.3 は、少なくとも 1 つの主要な脆弱性発見ベンチマークで完全なリードを主張しながら、コーディングとエージェント タスクに関する閉ざされた領域への距離を縮めます。これはオープンウェイト モデルとして行われます。つまり、リリースされたウェイトは誰でも無料でダウンロード、研究、構築できるようになります。この開放性が進歩を加速させるのか、それとも新たな安全保障上の懸念を引き起こすのかは議論の余地があり、GLM-5.3 が再燃することはほぼ確実です。
AI の一歩先を行く
最新の AI モデルのリリース、ベンチマーク バトル、業界分析については、AI Buzz Wire をブックマークしてください。
AI ニュースをもっと読む→