Tencent は、同社がオープンソースのフロンティアに位置付けている、Hunyuan チームの新しい主力大規模言語モデルである Hy4 プレビューをリリースし、オープンソース化しました。この重みは、より安価な推論のための FP8 量子化バリアントとともに、寛容な Apache 2.0 ライセンスの下で、8 月 28 日に Hugging Face、ModelScope、GitCode、CNB に導入されました。

この発表により、オープンウェイトのフロンティアモデルを出荷する中国の研究所間の競争が激化する。この分野には現在、Z.AIのGLMシリーズやMoonshot AIのKimiモデルが含まれる。ブルームバーグの報道によると、テンセントは新モデルが内部テストで両ライバルを上回っていると主張しているが、この主張はベンダーが実施する他の評価と同様、精査に値する。 この件の詳細は、人工知能の最新情報をご覧ください。

見出しの番号

Hy4 プレビューは、合計 7,700 億のパラメーターを備えた専門家混合 (MoE) モデルで、そのうち 490 億がトークンごとにアクティブ化されます。 Tencent-Hunyuan GitHub リポジトリで公開されている公式モデル カードによると、バックボーンには 78 層、256 人のルーティングされたエキスパートと 1 人の共有エキスパートがあり、トークンごとに上位 8 人のルーティングされたエキスパートをアクティブ化します。ネイティブのマルチトークン予測 (MTP) レイヤー (合計 100 億のパラメーター、7 億のアクティブ化) が投機的デコード用に組み込まれています。

コンテキスト ウィンドウはもう 1 つの主要な仕様です。100 万トークンという長さは、モデルがコードベース全体、長い法的文書、または 1 時間にわたる会議の記録を 1 回のパスで処理できる長さです。

ライバルからアーキテクチャを借用し、その上に構築

Tencent のドキュメントには、フラッグシップ製品としては異例の率直さで、このアテンション モジュールは「DeepSeek と GLM からインスピレーションを得た」と記載されています。 Hy4 プレビューでは、レイヤー間のスパース インデックスの再利用のために、Gated DeepSeek Sparse Attendance (Gated DSA) と IndexCache を組み合わせて使用​​し、残りのパスウェイでは、レイヤー間の情報フローを拡張するために ID Hyper-Connections (iHC) を使用します。

オープン性は、モデルを評価する開発者にとって重要です。まばらな注意が、1M トークンのコンテキストを経済的に提供できるものにします。これは、その長さの単純な完全な注意は法外に高価になるためです。 DeepSeek と Z.AI はどちらも、この設計のバリエーションを自社の主力モデルで出荷しています。

生産性を高めるために構築され、社内の専門家と調整されています

Tencent は、社内の専門家 (ソフトウェア エンジニア、ゲーム開発者、財務アナリスト、セキュリティ専門家) と提携し、彼らが実際に出荷する作品に基づいてトレーニング データを構築したと述べています。モデル カードでは、次の 4 つの重点領域を強調しています。

  • ソフトウェア エンジニアリング: 長期的な開発タスクの計画、デバッグ、検証が改善され、さらにフロントエンドの「ビジュアル テイスト」が向上しました。
  • オフィスと分析: 方程式と財務モデルをより強力に処理して、乱雑な複数ファイルのコンテキストを共有可能なドキュメント、スプレッドシート、プレゼンテーションに変換します。
  • ゲーム開発: 単一のプロンプトからプレイ可能なプロトタイプを生成し、複数のリファインメント ターンにわたってゲーム エンジンをスムーズに操作します。
  • 科学研究: AI 研究、分子動力学、物性物理学、純粋数学の問題における進歩を主張。

Tencent はまた、Hy4 プレビューは自社製品である CodeBuddy および WorkBuddy と共同設計されたため、モデルの向上が製品の改善につながるとも述べています。

Tencent 独自のベンチマークが示すもの

発表資料の中で最も具体的な比較は、テンセントが 163 人の社内専門家とともに実施した、203 のエンジニアリング タスクの成果を評価するブラインド サイドバイサイド評価です。これらのテストでは、Hy4 プレビューの平均スコアは 2.99 で、GLM 5.3 の 2.92 (勝ち 46.8 パーセント、引き分け 12.8 パーセント、負け 40.4 パーセント) や Kimi K3 の 2.94 (勝ち 51.2 パーセント、引き分け 7.9 パーセント、負け 40.9 パーセント) をわずかに上回りました。

2 つの注意点を明確に述べておく価値があります。まず、これらは Tencent の内部評価であり、独立したベンチマークではありません。同社はまだ公開リーダーボードで3次検証結果を公表していない。第二に、その差は狭く、主観的な専門家評価スケールにおける 0.05 ~ 0.07 ポイントの差は、異なる評価集団が簡単に逆転できる範囲内にあります。

今後数週間以内にコミュニティが標準化されたコーディング、推論、エージェント スイートを通じてモデルを実行するため、独立した検証がパブリック アグリゲーションから行われる予定です。

既知のバグを伴う早期出荷

Tencent は、これがプレビューであることを明確にしています。モデル カードには、複雑なタスクによる推論に必要以上に時間がかかることや、自身の作業を過剰に検証する傾向など、既知の制限が列挙されています。チームは、Hy3 世代を改善したアプローチを挙げて、「むしろ早めに出荷して、何が壊れるかを聞く」と述べています。

導入では、重みは BF16 と FP8 の両方で利用でき、vLLM と SGLang でのデイワン サポートが提供されます。 Tencent は、両方のビルド済み Docker イメージを公開しており、レシピでは 8 GPU にわたるテンソル並列処理と、遅延に敏感なサービスを提供するための MTP ベースの投機的デコードを推奨しています。微調整パイプラインと AngelSlim 量子化ツールキットがモデルに同梱されています。

なぜそれが重要なのか

中国の無差別級レースは、Z.AIのGLMシリーズとMoonshotのキミモデルの二正面戦争となり、ディープシーク、クウェン、そして今でははるかに規模の大きなフンユアンのエントリーがフィールドにひしめき合っている。 Hy4 プレビューの Apache 2.0 ライセンス、770B パラメータ スケール、1M トークン コンテキストの組み合わせにより、誰でもダウンロードしてセルフホストできるものの上限が引き上げられ、vLLM と SGLang のデイワン サポートにより、実際に実行する障壁が低くなります。

オープン モデルと欧米のクローズド API を比較検討する企業にとって、実際的な問題は、オープン モデルが机上のクローズド パフォーマンスに匹敵するかどうかではなく、周囲のツール (量子化、提供、微調整) が十分に成熟しているかどうかです。 Tencent は、Hunyuan が話題に戻る方法として、寛容なライセンスの下ですべてを一度に出荷することに賭けている。

内部ベンチマークの主張が独立したテストで有効かどうかによって、Hy4 プレビューが真のフロンティア オープンソース リリースとして記憶されるか、混雑した分野の別のベンダー ベンチマークとして記憶されるかが決まります。重みは現在公開されているため、コミュニティの評決にはそれほど時間はかからないはずです。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →