ドイツの AI 企業 Aleph Alpha は、ドイツ語と英語向けにゼロから構築されたオープンウェイトの専門家混合言語モデルである Kolibri をリリースしました。このモデルには合計 781 億個のパラメータが詰め込まれていますが、トークンごとに有効化されるのはそのうちの 34 億 6000 万個 (約 4.4%) だけであり、Hugging Face では寛容な Apache 2.0 ライセンスの下で出荷されます。最大 1,048,576 個のコンテキスト トークンを受け入れ、ユーザーはリクエストごとに推論の労力を設定できます。オープンウェイトのエコシステムを追跡している読者にとって、これは私たちの 最新の AI 開発 と並行して取り上げられます。
このリリースは、Aleph Alphaが自社の市場をどこに見ているかについての意図的な声明である。つまり、行政、産業、航空宇宙などの規制部門における主権展開であり、モデルがどこで、どのデータに基づいて、どの法的枠組みの下でトレーニングされたかを正確に知ることは、あると便利ではなく調達要件である。
コリブリとは実際には何ですか
技術資料では Kolibri-1 と呼ばれる Kolibri は、英語とドイツ語のバイリンガル MoE 変圧器であり、Aleph Alpha によれば、ドイツのチームによってエンドツーエンドで開発されたとのことです。同社の技術調査報告書によると、チームは別のラボのチェックポイントから開始するのではなく、データ、アーキテクチャ、トレーニングインフラストラクチャ、ポストトレーニング、評価といったパイプライン全体を制御したという。
トレーニングはドイツとフィンランドにあるインフラ上で実施されました。設計プロセスでは、EU 汎用 AI 実施規範、EU AI 法、および GDPR への準拠を明確に目標としており、Aleph Alpha はその規範に署名しています。同社によると、自社のデータパイプラインはトレーニング前に個人データを編集しているが、これは出所が不明確なモデルに市民データを法的に入力できない公共部門の購入者を直接ターゲットにしているという。
単一の GPU で実行されます
導入可能性は明らかに設計上の制約であり、後から考えたものではありません。 FP8 チェックポイントの容量は約 78 GB で、1 つの NVIDIA B200、B300、または H200、または 2 つの H100 SXM5 GPU 上で実行され、専用の Kolibri 推論およびツール呼び出しパーサーを備えた vLLM を通じて提供されます。 780 億パラメータのモデルの場合、これはハードウェアの設置面積が控えめであり、まばらな MoE 設計の直接の成果です。トークンごとにアクティブなパラメータが 34 億 6000 万のみであるため、推論コストは合計ではなくアクティブなパラメータの数を追跡します。
少数の専門家とハイブリッドな注意力
Kolibri はボンネットの下に、モデル幅 2,560 の変圧器ブロックを 50 個積み重ねています。すべての MoE レイヤーは、シグモイド ルーターを使用して 384 人のルーティングされたエキスパートすべてをスコアリングし、各トークンを上位 6 つに送信し、常に 1 人の共有エキスパートを並行して実行します。エキスパートの負荷は、ルータがすべてのトラフィックを少数のスペシャリストに集中させないようにする、アルファベットのスープ名の 2 つの技術、正確な分位数バランシングとロードエラー インジェクションを使用して分散されます。
注目すべきは、アーキテクチャがより興味深いところです。 Kolibri は 48 個のクエリ ヘッドと 4 個の KV ヘッドを持つグループ化されたクエリ アテンションを使用しますが、レイヤーは均一ではありません。5 つおきのブロックは位置エンコーディングなしで完全なアテンションを使用し、他の 40 ブロックは RoPE を使用して、512 個の先行トークンに対してスライディング ウィンドウ アテンションを使用します。実際の結果はメモリ効率です。スライディング ウィンドウ レイヤーは固定サイズの KV キャッシュを保持するため、コンテキストの長さに応じて増加するのは 50 レイヤーのうち 10 レイヤーのみです。 Aleph Alpha は、マッチド コンピューティングにおいて、ハイブリッド設計が同等のフルアテンション モデルよりも 4 倍長いシーケンスをサポートすると報告しています。これが、このサイズのモデルが、特殊なインフラストラクチャなしで 100 万トークンのコンテキスト ウィンドウを要求する方法です。
ドイツ語用に構築されたトークナイザー
ほとんどのフロンティアトークナイザーはドイツ語を後付けとして扱い、その長い複合語を断片に分割し、トークン数と実効コストを増大させます。 Aleph Alpha は、BPE と同じ方法でマージを構築する 128,000 トークンのボキャブラリである UniBPE を使用してこれを直接攻撃しましたが、各マージは Unigram 損失によってスコア付けされます。
数字がそれを物語ります。ドイツ語テキストでは、Kolibri のトークナイザーはトークンあたり 4.90 バイトに達しますが、GPT-5 トークナイザーでは 4.35 バイトです。これは、ドイツ語の Web テキストではトークンが 11.2 パーセント少ないことを意味します。英語に関しても、Kolibri が実際に優れており、GPT-5 の 4.67 バイトに対して 1 トークンあたり 4.58 バイトとなっています。トークンで支払う企業顧客の場合、ドイツ語のすべてのワークロードが直接割引されます。
最先端の規模でトレーニングを受けています
コリブリの背後でのトレーニングは充実しています。事前トレーニングでは 768 個の NVIDIA B200 GPU 上の 20 兆のトークンがカバーされ、続いて 65,536 トークンのシーケンス長で 3 兆 4,400 億の中間トレーニング トークンがカバーされました。その後、パイプラインは教師あり微調整と強化学習の段階を経て、最終的な命令に従う推論可能なモデルを生成しました。同社はプロセスを網羅した技術調査報告書を公表したが、これは欧州の研究所としては異例のレベルの開示であり、明らかに規制対象の顧客との信頼構築を目的としたものである。
ヨーロッパの AI 推進にとっての意味
コリブリは、米国と中国の研究所からの無差別リリースが話題の大半を占め、欧州政府がデジタル主権についてますます発言を強めている市場に参入する。アレフ・アルファの賭けは、その市場の一部(省庁、防衛に隣接する産業、重要インフラ)が、単に無差別級であるだけでなく、データ処理、訓練場所、法的態勢において検証可能なヨーロッパのモデルにお金を払うことだ。
その賭けが報われるかどうかは、このリリースでまだ答えられていない疑問、つまり標準評価でフロンティアオープンモデルに対してコリブリがどのようにベンチマークを行うのか、そしてそれを中心にツールのエコシステムがどのくらいの速さで形成されるのかにかかっています。このリリースで明らかになっているのは、フロンティアに隣接したフルスタックの訓練能力が現在 EU 内に存在しており、それに対応する事務手続きが整っているということである。 GDPR と AI 法に拘束されている組織にとって、その組み合わせはリーダーボードの順位よりも重要である可能性があります。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→