Google melancarkan EmbeddingGemma 2, model pembenaman terbuka dan ringan yang secara asalnya memetakan gabungan teks, imej, audio dan video ke dalam satu ruang benam bersatu. Pengumuman itu, yang disiarkan pada 6 Oktober 2026 oleh jurutera penyelidikan Google DeepMind, Sahil Dua dan Henrique Schechter Vera, meletakkan model 740 juta parameter sebagai pilihan yang paling berkebolehan untuk benam multimodal pada peranti, dikeluarkan di bawah lesen Apache 2.0 yang dibenarkan secara komersial dan dibina di atas seni bina Gemma 4.

EmbeddingGemma yang pertama melebihi jangkaan Google, dengan lebih daripada 20 juta muat turun yang menjanakan alat carian pada peranti dan saluran paip penjanaan tambahan untuk mendapatkan semula privasi yang pertama. Sekuel ini menjana minat pembangun serta-merta, menarik salah satu perbincangan Hacker News terbesar hari ini apabila pembina menilai maksud satu pembenam multimodal tunggal untuk apl AI news tempatan, perpustakaan media dan sistem RAG yang tidak pernah menyentuh awan.

Satu Model untuk Teks, Kod, Imej, Audio dan Video

Keupayaan tajuk EmbeddingGemma 2 ialah multimodaliti asli. Daripada menjalankan pengekod berasingan bagi setiap modaliti dan mencantumkan hasil bersama, model ini membenamkan gabungan teks, kod, imej, video dan audio ke dalam satu ruang kongsi. Contoh Google termasuk mencari klip video tertentu menggunakan memo suara sebagai pertanyaan, atau mencari jam rakaman audio dengan gesaan teks, semuanya diproses oleh satu model pada perkakasan tempatan.

Seni bina adalah modular. Teras teks sahaja memerlukan sekurang-kurangnya 270 juta parameter, dengan pengekod penglihatan pilihan (170 juta parameter) dan audio (300 juta parameter) menambah sokongan multimodal penuh. Oleh itu, pembangun boleh menggunakan pembenam teks padat hari ini dan berkembang menjadi perolehan pelbagai mod penuh tanpa mengubah keluarga model.

Keputusan Penanda Aras dan Kecekapan Penyimpanan

Google melaporkan bahawa EmbeddingGemma 2 mencapai skor utama dalam kalangan pembenam multimod sub-1B pada penanda aras termasuk Kod MTEB (Massive Text Embedding Benchmark) dan MAEB (Massive Audio Embedding Benchmark), sambil memadankan atau mengatasi prestasi banyak model yang lebih besar merentas tugasan teks, penglihatan dan audio. Keuntungan yang paling konkrit adalah dalam kod: Prestasi Kod MTEB melonjak 9.92 mata, daripada 68.76 kepada 78.68, yang menurut Google menjadikan model itu sangat sesuai untuk pengindeksan pangkalan kod tempatan, carian kod semantik dan pengambilan ejen pengekodan. Merentasi imej, video, dokumen dan audio, syarikat itu menuntut standard baharu dalam kualiti-per-parameter untuk model sub-1B, mengatakan ia malah mengatasi beberapa model pakar lebih daripada dua kali ganda saiznya.

Kecekapan penyimpanan datang daripada Pembelajaran Perwakilan Matryoshka (MRL). Vektor output boleh dipotong secara dinamik daripada 768 dimensi kepada 512, 256 atau 128 dimensi, memberikan sehingga 6x pengurangan storan untuk pangkalan data vektor tempatan dan penggunaan memori. Bagi pembangun yang menjalankan pengambilan semula pada telefon atau perkakasan terbenam, perbezaan itu sering menentukan sama ada ciri dihantar sama sekali.

Direka untuk Belanjawan Perkakasan yang ketat

Jejak pada peranti ialah titik jualan teras model. Dengan pengkuantitian, Google melaporkan bahawa EmbeddingGemma 2 memerlukan sekurang-kurangnya 191MB RAM aktif untuk pemberat teks sahaja dan kira-kira 567MB untuk model multimodal penuh pada Google Pixel 11 Pro. Tetingkap konteks juga telah berkembang kepada 8,000 token, empat kali lebih besar daripada EmbeddingGemma 1, cukup untuk memproses sehingga 5.5 minit audio, 29 imej atau 58 bingkai video dalam satu laluan atau gabungan bersilang daripadanya.

Disebabkan model itu berkongsi tokenizer teks dan pengekod audionya dengan Gemma 4, pembangun boleh menjalankan EmbeddingGemma 2 bersama-sama Gemma 4 dalam saluran paip bersatu dengan jejak memori gabungan yang lebih rendah, membolehkan RAG pada peranti di mana pengambilan dan penjanaan kedua-duanya berlaku secara tempatan. Google menunjukkan perkara ini dalam aplikasi AI Edge Foresight, menggandingkan pengambilan fail tempatan dengan penaakulan kontekstual Gemma 4.

Peralatan dan Ketersediaan

Model ini tersedia melalui alat AI Edge Google. Apl Galeri Google AI Edge mempamerkan Carian Media Segera, yang mencari padanan perpustakaan mengikut persamaan semantik daripada pertanyaan teks atau imej, dan Pencari Detik Video yang mengesan adegan tertentu menggunakan pertanyaan teks atau audio. Klasifikasi masa nyata, penghalaan dan kes penggunaan ramalan didedahkan melalui MediaPipe Decision Task API, dan blog AI Edge Google mendokumenkan cara membina carian pada peranti dan sistem RAG dengan LiteRT. Metrik penilaian penuh tersedia dalam kad model.

Mengapa Pembenaman Pada Peranti Penting

Model pembenaman jarang menjadi tajuk utama seperti model sembang sempadan, tetapi ia terletak di bawah kebanyakan ciri AI praktikal: carian semantik, pengesyoran, penyahduplikasian, pengelasan dan perolehan semula untuk RAG. Menjalankannya secara tempatan mengubah kalkulus privasi dan kependaman sepenuhnya. Data tidak pernah meninggalkan peranti, pertanyaan berfungsi di luar talian dan tiada kos API setiap panggilan, yang penting pada skala berbilion peranti terbenam.

EmbeddingGemma 2 juga meningkatkan persaingan dalam ruang model terbuka yang cekap, di mana Google, Meta, Mistral dan kohort makmal yang lebih kecil berlumba-lumba untuk membuktikan bahawa AI yang berguna boleh berjalan tanpa pusat data. Model parameter 740M yang mengendalikan lima modaliti pada telefon adalah penanda ketara dalam perlumbaan itu. Jika trajektori muat turun pendahulunya ialah sebarang petunjuk, jangkakan EmbeddingGemma 2 akan muncul dalam pelbagai jenis produk mudah alih dan edge dalam beberapa bulan akan datang.

Kekal Mendahului Keluk AI

AI pada peranti berkembang lebih pantas daripada yang disedari kebanyakan orang. Baca berita AI terbaharu di aibuzzwire.news untuk liputan setiap pelancaran model utama, penanda aras dan keluaran alat pembangun.

Baca lebih banyak berita AI →