Google ngluncurake EmbeddingGemma 2, model embedding sing mbukak lan entheng sing asline peta kombinasi teks, gambar, audio, lan video dadi ruang semat tunggal. Pengumuman kasebut, sing dikirim tanggal 6 Oktober 2026 dening insinyur riset Google DeepMind, Sahil Dua lan Henrique Schechter Vera, nempatake model parameter 740 yuta minangka pilihan paling apik kanggo embeddings multimodal ing piranti, dirilis miturut lisensi Apache 2.0 sing idin komersial lan dibangun ing arsitektur Gemma 4.

EmbeddingGemma pisanan ngluwihi pangarepan Google, kanthi luwih saka 20 yuta undhuhan sing nguwasani alat telusuran ing piranti lan saluran pipa generasi sing ditambahake privasi. Sekuel kasebut langsung narik minat pangembang, dadi salah sawijining diskusi Hacker News paling gedhe ing dina iki nalika para tukang ngevaluasi apa tegese embedder multimodal siji kanggo aplikasi lokal AI news, perpustakaan media, lan sistem RAG sing ora tau ndemek awan.

Siji Model kanggo Teks, Kode, Gambar, Audio, lan Video

Kapabilitas judhul EmbeddingGemma 2 yaiku multimodalitas asli. Tinimbang nglakokake encoder sing kapisah saben modalitas lan asil jahitan bebarengan, model kasebut nggabungake kombinasi teks, kode, gambar, video, lan audio menyang siji papan sing dienggo bareng. Conto Google kalebu nemokake klip video tartamtu nggunakake memo swara minangka pitakon, utawa nggoleki jam rekaman audio nganggo pituduh teks, kabeh diproses dening model siji ing hardware lokal.

Arsitektur punika modular. Inti mung teks mbutuhake mung 270 yuta paramèter, kanthi visi opsional (170 yuta paramèter) lan audio (300 yuta paramèter) encoders nambah dhukungan multimodal lengkap. Mulane, pangembang bisa masang embedder teks kompak dina iki lan berkembang dadi multimodal retrieval lengkap tanpa ngganti kulawarga model.

Asil Patokan lan Efisiensi Panyimpenan

Google nglaporake manawa EmbeddingGemma 2 entuk skor utama ing antarane embedder multimodal sub-1B ing benchmark kalebu Kode MTEB (Massive Text Embedding Benchmark) lan MAEB (Massive Audio Embedding Benchmark), nalika cocog utawa ngluwihi akeh model sing luwih gedhe ing teks, visi, lan tugas audio. Keuntungan sing paling konkrit yaiku ing kode: Kinerja MTEB Code mlumpat 9,92 poin, saka 68,76 dadi 78,68, sing dikandhakake Google ndadekake model kasebut cocog karo indeksasi basis kode lokal, telusuran kode semantik, lan pengambilan agen coding. Across gambar, video, dokumen, lan audio, perusahaan claims standar anyar kualitas-saben-parameter kanggo model sub-1B, ngandika malah outperforms sawetara model spesialis luwih saka kaping pindho ukuran.

Efisiensi panyimpenan asale saka Matryoshka Representation Learning (MRL). Vektor output bisa dipotong kanthi dinamis saka 768 dimensi nganti 512, 256, utawa 128 dimensi, ngirim nganti 6x panyimpenan kanggo database vektor lokal lan panggunaan memori. Kanggo pangembang sing njupuk maneh ing telpon utawa piranti keras sing dipasang, prabédan kasebut asring nemtokake manawa fitur kasebut dikirim.

Dirancang kanggo Anggaran Hardware Nyenyet

Jejak ing piranti minangka titik jual inti model kasebut. Kanthi kuantisasi, Google nglaporake manawa EmbeddingGemma 2 mbutuhake RAM aktif kira-kira 191MB kanggo bobot mung teks lan udakara 567MB kanggo model multimodal lengkap ing Google Pixel 11 Pro. Jendhela konteks uga wis tuwuh dadi 8.000 token, kaping papat luwih gedhe tinimbang EmbeddingGemma 1, cukup kanggo ngolah audio nganti 5,5 menit, 29 gambar, utawa 58 bingkai video ing siji pass, utawa kombinasi interleaved.

Amarga model kasebut nuduhake tokenizer teks lan encoder audio karo Gemma 4, pangembang bisa mbukak EmbeddingGemma 2 bebarengan karo Gemma 4 ing pipa gabungan kanthi jejak memori gabungan sing luwih murah, ngidini RAG ing piranti ing ngendi njupuk lan generasi loro kedadeyan sacara lokal. Google nduduhake iki ing aplikasi AI Edge Foresight, masangake pengambilan file lokal karo pertimbangan kontekstual Gemma 4.

Perkakas lan Kasedhiyan

Model kasebut kasedhiya liwat alat AI Edge Google. Aplikasi Google AI Edge Gallery nampilake Instant Media Search, sing nemokake cocog perpustakaan kanthi persamaan semantik saka pitakon teks utawa gambar, lan Video Moments Finder sing nemokake adegan tartamtu nggunakake pitakon teks utawa audio. Klasifikasi wektu nyata, rute, lan kasus panggunaan prediktif kapapar liwat MediaPipe Decision Task API, lan blog AI Edge Google nyathet carane mbangun telusuran ing piranti lan sistem RAG nganggo LiteRT. Metrik evaluasi lengkap kasedhiya ing kertu model.

Napa Embeddings Ing Piranti Penting

Model semat arang nggawe judhul kaya model chatting perbatasan, nanging ana ing sangisore fitur AI sing paling praktis: telusuran semantik, rekomendasi, deduplikasi, klasifikasi, lan njupuk RAG. Mlaku kanthi lokal ngganti kalkulus privasi lan latensi kabeh. Data ora tau ninggalake piranti kasebut, pitakon bisa digunakake ing offline, lan ora ana biaya API saben telpon, sing penting ing skala milyar piranti sing dipasang.

EmbeddingGemma 2 uga nggedhekake kompetisi ing ruang model terbuka sing efisien, ing ngendi Google, Meta, Mistral, lan klompok laboratorium cilik balapan kanggo mbuktekake manawa AI migunani bisa mlaku tanpa pusat data. Model 740M-parameter nangani limang modalitas ing telpon minangka tandha penting ing balapan kasebut. Yen lintasan download saka leluhure minangka indikasi, ngarepake EmbeddingGemma 2 bakal ditampilake ing macem-macem produk seluler lan pinggiran sajrone sawetara wulan.

Tetep Ahead saka Kurva AI

AI ing piranti maju luwih cepet tinimbang sing dingerteni umume wong. Waca warta AI paling anyar ing aibuzzwire.news kanggo jangkoan saben peluncuran model utama, pathokan, lan rilis alat pangembang.

Waca liyane warta AI →