Google は、テキスト、画像、オーディオ、ビデオの組み合わせを単一の統合された埋め込みスペースにネイティブにマッピングする、オープンで軽量の埋め込みモデルである EmbeddingGemma 2 を発表しました。 Google DeepMind の研究エンジニアである Sahil Dua 氏と Henrique Schechter Vera 氏が 2026 年 10 月 6 日に投稿したこの発表では、商業的に許容される Apache 2.0 ライセンスの下でリリースされ、Gemma 4 アーキテクチャに基づいて構築された、7 億 4,000 万パラメータのモデルがオンデバイスのマルチモーダル エンベディングの最も有能なオプションであると位置づけられています。
最初の EmbeddingGemma は Google の予想を上回り、2,000 万を超えるダウンロードがデバイス上の検索ツールとプライバシー優先の検索拡張生成パイプラインを強化しました。この続編はすぐに開発者の関心を呼び起こし、クラウドに決して触れないローカルの AI ニュース アプリ、メディア ライブラリ、RAG システムにとって単一のマルチモーダル エンベッダーが何を意味するかをビルダーが評価する中で、その日最大のハッカー ニュース ディスカッションの 1 つを引き起こしました。
テキスト、コード、画像、オーディオ、ビデオの 1 つのモデル
EmbeddingGemma 2 のヘッドライン機能はネイティブのマルチモダリティです。このモデルは、モダリティごとに個別のエンコーダーを実行して結果をつなぎ合わせるのではなく、テキスト、コード、画像、ビデオ、オーディオの組み合わせを 1 つの共有スペースに埋め込みます。 Google の例には、クエリとしてボイスメモを使用して特定のビデオクリップを検索したり、テキストプロンプトを使用して何時間もの音声録音を検索したりすることが含まれており、すべてローカルハードウェア上の単一モデルで処理されます。
アーキテクチャはモジュール式です。テキストのみのコアに必要なパラメータはわずか 2 億 7,000 万で、オプションのビジョン (1 億 7,000 万パラメータ) およびオーディオ (3 億パラメータ) エンコーダを使用すると、完全なマルチモーダル サポートが追加されます。したがって、開発者は今すぐコンパクトなテキスト エンベッダーを導入し、モデル ファミリを変更することなく完全なマルチモーダル検索に拡張できます。
ベンチマーク結果とストレージ効率
Google の報告によると、EmbeddingGemma 2 は、MTEB (Massive Text Embedding Benchmark) コードや MAEB (Massive Audio Embedding Benchmark) などのベンチマークでサブ 1B 未満のマルチモーダル エンベッダーの中で最高のスコアを達成し、テキスト、ビジョン、オーディオ タスク全体で多くのより大きなモデルと同等またはそれを上回るパフォーマンスを示しています。最も具体的な改善はコードにあります。MTEB コードのパフォーマンスは 68.76 から 78.68 に 9.92 ポイント上昇しました。これにより、このモデルはローカル コードベースのインデックス作成、セマンティック コード検索、およびコーディング エージェントの取得に適したモデルになったと Google は述べています。同社は、画像、ビデオ、ドキュメント、オーディオにわたって、サブ 1B モデルのパラメータごとの品質における新しい標準を主張し、一部の専門モデルよりもサイズが 2 倍以上優れているとさえ述べています。
ストレージ効率は Matryoshka Representation Learning (MRL) から得られます。出力ベクトルは 768 次元から 512、256、または 128 次元まで動的に切り詰めることができ、ローカル ベクトル データベースとメモリ使用量のストレージを最大 6 倍削減できます。携帯電話または組み込みハードウェアで取得を実行している開発者にとって、その違いによって機能が提供されるかどうかが決まることがよくあります。
厳しいハードウェア予算向けに設計
デバイス上の設置面積は、このモデルの中核的なセールスポイントです。 Google の報告によると、EmbeddingGemma 2 では、量子化の場合、テキストのみの重みの場合はわずか約 191MB のアクティブ RAM が必要で、Google Pixel 11 Pro の完全なマルチモーダル モデルの場合は約 567MB しか必要ありません。コンテキスト ウィンドウも 8,000 トークンに増加し、EmbeddingGemma 1 の 4 倍となり、シングル パスで最大 5.5 分の音声、29 枚の画像、または 58 枚のビデオ フレーム、またはそれらのインターリーブされた組み合わせを処理するのに十分です。
このモデルはテキスト トークナイザーとオーディオ エンコーダーを Gemma 4 と共有しているため、開発者は統合されたパイプラインで Gemma 4 と並行して EmbeddingGemma 2 を実行でき、合計メモリ フットプリントが低くなり、取得と生成の両方がローカルで行われるオンデバイス RAG が可能になります。 Google は、ローカル ファイルの取得と Gemma 4 のコンテキスト推論を組み合わせた AI Edge Foresight アプリでこれを実証しています。
ツールと可用性
このモデルは、Google の AI Edge ツールを通じて利用できます。 Google AI Edge Gallery アプリは、テキストまたは画像クエリから意味論的な類似性によってライブラリの一致を見つけるインスタント メディア検索と、テキストまたはオーディオ クエリを使用して特定のシーンを見つけるビデオ モーメント ファインダーを紹介します。リアルタイムの分類、ルーティング、予測のユースケースは、MediaPipe Decision Task API を通じて公開されており、Google の AI Edge ブログでは、LiteRT を使用してオンデバイス検索および RAG システムを構築する方法が文書化されています。完全な評価指標はモデル カードで利用できます。
オンデバイスの埋め込みが重要な理由
埋め込みモデルは、フロンティア チャット モデルのように見出しになることはほとんどありませんが、セマンティック検索、推奨、重複排除、分類、RAG の取得など、最も実用的な AI 機能の下に位置します。これらをローカルで実行すると、プライバシーと遅延の計算が完全に変わります。データがデバイスの外に出ることはなく、クエリはオフラインで動作し、呼び出しごとの API コストは発生しません。これは、数十億台の組み込みデバイスの規模で問題となります。
EmbeddingGemma 2 はまた、効率的なオープンモデル分野での競争を激化させます。そこでは、Google、Meta、Mistral、および小規模な研究機関のグループが、データセンターなしで有用な AI が実行できることを証明しようと競い合っています。電話機で 5 つのモダリティを処理する 740M パラメータのモデルは、この競争において注目すべきマーカーです。前バージョンのダウンロードの軌跡が何らかの兆候である場合は、EmbeddingGemma 2 が今後数か月間、幅広いモバイルおよびエッジ製品に登場することが予想されます。
AI 曲線の先を行く
オンデバイス AI は、ほとんどの人が思っているよりも速く進歩しています。 aibuzzwire.news で最新の AI ニュースを読む で、すべての主要モデルの発売、ベンチマーク、開発者ツールのリリースについて取り上げています。
AIニュースをもっと読む→