Google meluncurkan EmbeddingGemma 2, model penyematan terbuka dan ringan yang secara asli memetakan kombinasi teks, gambar, audio, dan video ke dalam satu ruang penyematan terpadu. Pengumuman tersebut, yang diposting pada tanggal 6 Oktober 2026 oleh insinyur riset Google DeepMind Sahil Dua dan Henrique Schechter Vera, memposisikan model dengan 740 juta parameter sebagai opsi paling mumpuni untuk penyematan multimodal pada perangkat, dirilis di bawah lisensi Apache 2.0 yang permisif secara komersial dan dibangun di atas arsitektur Gemma 4.
EmbeddingGemma pertama melampaui ekspektasi Google, dengan lebih dari 20 juta unduhan yang mendukung alat pencarian di perangkat dan saluran generasi augmented pengambilan yang mengutamakan privasi. Sekuel ini langsung membangkitkan minat para pengembang, dan menarik salah satu diskusi Hacker News terbesar hari ini ketika para pembuat aplikasi mengevaluasi arti dari penyematan multimodal tunggal untuk aplikasi berita AI, perpustakaan media, dan sistem RAG lokal yang tidak pernah menyentuh cloud.
Satu Model untuk Teks, Kode, Gambar, Audio, dan Video
Kemampuan utama EmbeddingGemma 2 adalah multimodalitas asli. Daripada menjalankan encoder terpisah per modalitas dan menggabungkan hasilnya, model ini menyematkan kombinasi teks, kode, gambar, video, dan audio ke dalam satu ruang bersama. Contoh Google termasuk menemukan klip video tertentu menggunakan memo suara sebagai kueri, atau mencari rekaman audio berjam-jam dengan perintah teks, semuanya diproses oleh satu model pada perangkat keras lokal.
Arsitekturnya modular. Inti hanya teks memerlukan sedikitnya 270 juta parameter, dengan encoder vision opsional (170 juta parameter) dan audio (300 juta parameter) yang menambahkan dukungan multimodal penuh. Oleh karena itu, pengembang dapat menerapkan penyematan teks ringkas saat ini dan berkembang menjadi pengambilan multimodal penuh tanpa mengubah rangkaian model.
Hasil Tolok Ukur dan Efisiensi Penyimpanan
Google melaporkan bahwa EmbeddingGemma 2 mencapai skor tertinggi di antara penyemat multimodal sub-1B pada tolok ukur termasuk Kode MTEB (Massive Text Embedding Benchmark) dan MAEB (Massive Audio Embedding Benchmark), sekaligus menyamai atau mengungguli banyak model yang lebih besar dalam tugas teks, visi, dan audio. Keuntungan paling nyata ada pada kode: Kinerja Kode MTEB melonjak 9,92 poin, dari 68,76 menjadi 78,68, yang menurut Google membuat model ini cocok untuk pengindeksan basis kode lokal, pencarian kode semantik, dan pengambilan agen pengkodean. Di bidang gambar, video, dokumen, dan audio, perusahaan ini mengklaim standar baru dalam kualitas per parameter untuk model sub-1B, dengan mengatakan bahwa model tersebut bahkan mengungguli beberapa model spesialis yang berukuran lebih dari dua kali lipat.
Efisiensi penyimpanan berasal dari Matryoshka Representation Learning (MRL). Vektor keluaran dapat dipotong secara dinamis dari 768 dimensi menjadi 512, 256, atau 128 dimensi, sehingga memberikan pengurangan penyimpanan hingga 6x untuk database vektor lokal dan penggunaan memori. Bagi pengembang yang menjalankan pengambilan pada ponsel atau perangkat keras tertanam, perbedaan tersebut sering kali menentukan apakah suatu fitur dikirimkan atau tidak.
Dirancang untuk Anggaran Perangkat Keras yang Ketat
Jejak pada perangkat adalah nilai jual inti model ini. Dengan kuantisasi, Google melaporkan bahwa EmbeddingGemma 2 memerlukan sedikitnya sekitar 191 MB RAM aktif untuk bobot hanya teks dan sekitar 567 MB untuk model multimodal penuh di Google Pixel 11 Pro. Jendela konteks juga telah berkembang menjadi 8.000 token, empat kali lebih besar dari EmbeddingGemma 1, cukup untuk memproses audio hingga 5,5 menit, 29 gambar, atau 58 bingkai video dalam satu lintasan, atau kombinasi interleavednya.
Karena model ini berbagi tokenizer teks dan encoder audio dengan Gemma 4, pengembang dapat menjalankan EmbeddingGemma 2 bersama Gemma 4 dalam saluran terpadu dengan jejak memori gabungan yang lebih rendah, memungkinkan RAG pada perangkat tempat pengambilan dan pembuatan terjadi secara lokal. Google mendemonstrasikan hal ini dalam aplikasi AI Edge Foresight, yang memadukan pengambilan file lokal dengan penalaran kontekstual Gemma 4.
Peralatan dan Ketersediaan
Model ini tersedia melalui alat AI Edge Google. Aplikasi Google AI Edge Gallery menampilkan Pencarian Media Instan, yang menemukan kecocokan perpustakaan berdasarkan kesamaan semantik dari kueri teks atau gambar, dan Pencari Momen Video yang menemukan lokasi adegan tertentu menggunakan kueri teks atau audio. Klasifikasi real-time, perutean, dan kasus penggunaan prediktif diekspos melalui MediaPipe Decision Task API, dan blog AI Edge Google mendokumentasikan cara membangun sistem penelusuran dan RAG di perangkat dengan LiteRT. Metrik evaluasi lengkap tersedia di kartu model.
Mengapa Penyematan di Perangkat Penting
Model penyematan jarang menjadi berita utama seperti yang dilakukan model obrolan frontier, tetapi model tersebut berada di bawah fitur AI yang paling praktis: pencarian semantik, rekomendasi, deduplikasi, klasifikasi, dan pengambilan untuk RAG. Menjalankannya secara lokal akan mengubah privasi dan kalkulus latensi sepenuhnya. Data tidak pernah keluar dari perangkat, kueri bekerja secara offline, dan tidak ada biaya API per panggilan, yang merupakan hal penting dalam skala miliaran perangkat yang disematkan.
EmbeddingGemma 2 juga mengintensifkan persaingan dalam ruang model terbuka yang efisien, di mana Google, Meta, Mistral, dan sekelompok laboratorium kecil berlomba untuk membuktikan bahwa AI yang berguna dapat berjalan tanpa pusat data. Model berparameter 740M yang menangani lima modalitas pada ponsel adalah penanda penting dalam perlombaan tersebut. Jika lintasan pengunduhan pendahulunya merupakan indikasi, EmbeddingGemma 2 diperkirakan akan muncul di berbagai produk seluler dan edge dalam beberapa bulan mendatang.
Tetap Terdepan dalam Kurva AI
AI pada perangkat berkembang lebih cepat dari yang diperkirakan kebanyakan orang. Baca berita AI terbaru di aibuzzwire.news untuk liputan setiap peluncuran model utama, benchmark, dan rilis alat pengembang.
Baca berita AI selengkapnya →