中国のAI研究所Moonshot AIは2026年7月16日にKimi K3を発表し、同社が「世界初のオープン3Tクラスモデル」と呼ぶもの、つまりAnthropicやOpenAIの最も強力な独自モデルとの差を縮める2.8兆パラメータのシステムをリリースした。このリリースはすぐに今年最も話題になった AI リリースの 1 つとなり、Hacker News のトップに上り詰め、ロイター、ブルームバーグ、ニューヨーク タイムズからも取り上げられました。

より広範な AI 業界の報道 にとって、Kimi K3 は重要です。それは、自由にダウンロードできるシステムがクローズドなシステムに匹敵するかどうかについて新たな議論を強いる一方で、オープンウェイト モデルの最前線を大幅に押し上げるからです。 Moonshot によると、完全なモデルの重量は 2026 年 7 月 27 日までにリリースされる予定です。

2.8 兆パラメータのオープン モデル

Moonshot の技術発表によると、Kimi K3 は 2.8 兆パラメータのモデルで、同社が Kimi Delta Attendant (KDA) と Attendance Residuals (AttnRes) と呼ぶ 2 つのアーキテクチャ アップデートに基づいて構築されています。これは、Moonshot が Stable LatentMoE フレームワークと呼ぶものと組み合わせて、特定のトークンに対して 896 人のエキスパートのうち 16 人のみをアクティブにする Mixture-of-Experts (MoE) 設計を使用しています。同社は、これらの変更により、以前の Kim K2 モデルと比較して全体的なスケーリング効率が約 2.5 倍向上すると主張しています。

このモデルには、ネイティブ ビジョン機能と 100 万トークンのコンテキスト ウィンドウも付属しています。アナリストのサイモン・ウィリソン氏は自身のウェブログで、キミ K3 がディープシークの 1.6 兆パラメータの v4 Pro からオープンサイズの王冠を奪ったと指摘した。これは、先行する 1 兆パラメータの キミ K2.6 の「2 倍以上のサイズ」である。

Moonshot は、このリリースを持続的なスケーリング推進の最新のステップとして位置づけ、過去 12 か月のうち 9 か月で同社のモデルがオープン モデルのサイズの上限を設定してきたと述べています。

ベンチマークでの比較

Moonshot 独自の評価スイートでは、Kimi K3 の全体的なパフォーマンスは、Anthropic の Claude Fable 5 と OpenAI の GPT-5.6 Sol という 2 つの独自システムに次ぐものとなっていますが、Claude Opus 4.8 や GPT-5.5 など、テストされた他のモデルよりも常に優れています。第三者による分析により、これらの主張が幅広く追跡されます。

独立した評価サービスである Artificial Analysis は、プライベートの長期ナレッジワーク ベンチマークで、キミ K3 が総合 Elo 1547 に達したと報告しました。これは、キミ K2.6 を 732 ポイント上回り、クロード ファブル 5 に次ぐものでした。発売後に広く広まったリーダーボードの投稿によると、アリーナ.ai のフロントエンド コード アリーナでは、キミ K3 がクロード ファブル 5 を上回り、第 1 位の座に上り詰めました。

価格設定はこの話の注目すべき部分です。 Artificial Analysis は、タスクあたりの平均コストを 0.94 ドルと固定しました。これは、GPT-5.6 Sol の 1.04 ドルに匹敵し、Claude Opus 4.8 の 1.80 ドルの約半分に相当します。その一方で、Kimi K3 が使用する出力トークンが以前のものより 21% 少ないことに注目しました。トークンごとにこのモデルの価格は、入力トークン 100 万あたり 3 ドル、出力トークン 100 万あたり 15 ドルです。これは Anthropic の Claude Sonnet シリーズと同じレベルであり、Willison 氏が観察したように、これまでに中国の AI 研究所がリリースした最も高価なモデルであり、Kimi K2.6 の 0.95 ドル/4 ドルを上回っています。

エージェント コーディングとそれ自体が構築するコンパイラー

Moonshot の発表の多くは、チャットボットのベンチマークではなく、長期的なエージェント タスクに焦点を当てていました。同社によれば、 Kim K3 は人間の監視を最小限に抑えながら、長時間のエンジニアリング セッションを維持し、大規模なコード リポジトリをナビゲートし、ターミナル ツールを調整できるという。

Moonshot 氏は、あるデモンストレーションで、開発の後期段階でのチーム独自の GPU カーネル最適化作業の大部分を、初期バージョンの Kim K3 が処理したと述べました。別のモデルでは、独自のタイル レベルの中間表現、最適化パス、および PTX コード生成パイプラインを備えたコンパクトな Triton のような GPU コンパイラーである「MiniTriton」を構築しました。 Moonshot は、MiniTriton が、サポートされているルーフライン ベンチマークおよび安定したコンバージェンスでの持続的なエンドツーエンドの nanoGPT トレーニングで確立された Triton および torch.compile スタックに匹敵するか、またはそれを上回ったと主張しています。

同社はまた、チップ設計における驚くべき概念実証も披露しました。報告によると、キミ K3 は、Nangate 45nm ライブラリのオープンソース EDA ツールを使用して、48 時間の 1 回の自律走行で、独自のアーキテクチャでナノ モデルを提供するように構築されたチップを設計、最適化、検証したと報告されています。 Moonshot 氏によると、この設計は 100 MHz でのタイミングを 4 mm² 以内で閉じ、シミュレーションでは 1 秒あたり 8,700 トークンを超えるデコード スループットを維持します。

研究面では、20以上の論文を相互検証し、300以上の状態方程式にわたる完全な数値パイプラインを実装し、3,000行以上のPythonを記述することで、Kimi K3は計算天体物理学からI-Love-Qの普遍関係を約2時間で再現したとムーンショット氏は述べた。この作業は研究者が通常1~2週間かかると同社は見積もっている。

無差別級の議論が帰ってくる

中国の研究所が米国のフロンティアモデルとの距離を繰り返し縮めてきた、あるいは縮めているように見えたため、キミK3の登場は2026年まで続く議論を再燃させている。このパターンは今やよく知られたものとなった。中国のリリースはリーダーボードの上位付近に自己申告の数字を掲載し、欧米の研究機関は成長を続ける独自の優位性を強調し、企業はコストとオープン性を生の能力と比較検討している。

その緊張感は価格設定にも表れています。 Claude Opus 4.8 の能力に近づきながら、タスクあたりのコストでそのモデルを下回っているにもかかわらず、以前の中国リリースよりも高額な料金を請求するこのモデルは、オープンなエコシステムでもプレミアム価格を設定できるという Moonshot の自信を反映しています。 Willison 氏は、単一のベンチマークを深読みしないように警告しました。彼が長年実施してきた「自転車に乗ったペリカン」テストは、もはや現実世界の品質と確実に相関していないと彼は書いています。しかし、このリリースは依然として実践的なテストに報いたと述べました。

Kimi K3 は、現在、Kimi.com、Kimi Work デスクトップ エージェント、Kimi Code 開発者ツール、および Kimi API を通じて入手できます。 Moonshot は、フルウェイトのリリースに先立って、信頼性の高い展開を確実にするために、推論パートナーやオープンソースのメンテナーと協力していると述べました。

AI の先を行く

モデルのリリース、ベンチマークの戦い、無差別級のフロンティアに関する継続的な報道については、AI Buzz Wire をフォローして、世界的な人工知能レースを形成する動向を確認してください。

AIモデルニュースをもっと読む→