Google, metin, resim, ses ve video kombinasyonlarını tek bir birleşik yerleştirme alanına yerel olarak eşleyen açık, hafif bir yerleştirme modeli olan EmbeddingGemma 2'yi başlattı. Google DeepMind araştırma mühendisleri Sahil Dua ve Henrique Schechter Vera tarafından 6 Ekim 2026'da yayınlanan duyuru, ticari olarak izin verilen bir Apache 2.0 lisansı altında piyasaya sürülen ve Gemma 4 mimarisi üzerine inşa edilen 740 milyon parametreli modeli, cihaz içi çok modlu yerleştirmeler için en yetenekli seçenek olarak konumlandırıyor.

İlk EmbeddingGemma, cihazdaki arama araçlarını destekleyen 20 milyondan fazla indirme ve gizlilik öncelikli erişim artırılmış üretim hatlarıyla Google'ın beklentilerini aştı. Devam filmi geliştiricilerin hemen ilgisini çekti ve inşaatçılar tek bir çok modlu yerleştirme aracının yerel AI news uygulamaları, medya kitaplıkları ve buluta asla dokunmayan RAG sistemleri için ne anlama geldiğini değerlendirirken günün en büyük Hacker News tartışmalarından birini çekti.

Metin, Kod, Görseller, Ses ve Video için Tek Model

GömmeGemma 2'nin ana yeteneği yerel çok modluluktur. Model, her modalite için ayrı kodlayıcılar çalıştırmak ve sonuçları bir araya getirmek yerine metin, kod, görüntü, video ve ses kombinasyonlarını tek bir paylaşılan alana yerleştirir. Google'ın örnekleri arasında, sorgu olarak bir sesli not kullanarak belirli bir video klibin bulunması veya bir metin istemi ile saatlerce süren ses kayıtlarının aranması yer alır; bunların tümü yerel donanım üzerinde tek bir model tarafından işlenir.

Mimari modülerdir. Salt metin çekirdeği, tam multimodal destek ekleyen isteğe bağlı görüntü (170 milyon parametre) ve ses (300 milyon parametre) kodlayıcılarla birlikte 270 milyon kadar az parametre gerektirir. Geliştiriciler bu nedenle kompakt bir metin yerleştirme aracını bugün devreye alabilir ve model ailelerini değiştirmeden tam çok modlu erişime geçebilirler.

Karşılaştırma Sonuçları ve Depolama Verimliliği

Google, EmbeddingGemma 2'nin, MTEB (Massive Text Embedding Benchmark) Code ve MAEB (Massive Audio Embedding Benchmark) dahil olmak üzere kıyaslamalarda 1B altı multimodal gömülerler arasında önde gelen puanlar elde ettiğini ve aynı zamanda metin, görüntü ve ses görevlerinde birçok büyük modelle eşleştiğini veya daha iyi performans gösterdiğini bildiriyor. En somut kazanç kodda oldu: MTEB Kod performansı 9,92 puan artarak 68,76'dan 78,68'e çıktı; Google bunun modeli yerel kod tabanı indeksleme, anlamsal kod arama ve kodlama aracısı alımı için çok uygun hale getirdiğini söylüyor. Görüntü, video, belgeler ve ses genelinde şirket, 1B altı modeller için parametre başına kalite açısından yeni bir standart talep ediyor ve hatta boyutunun iki katından daha fazla bazı uzman modellerden daha iyi performans gösterdiğini söylüyor.

Depolama verimliliği Matryoshka Temsil Öğreniminden (MRL) gelir. Çıkış vektörleri dinamik olarak 768 boyuttan 512, 256 veya 128 boyuta kesilebilir, böylece yerel vektör veritabanları ve bellek kullanımı için depolama alanında 6 kata kadar azalma sağlanır. Telefonlarda veya gömülü donanımlarda veri almayı çalıştıran geliştiriciler için bu fark genellikle bir özelliğin gönderilip gönderilmeyeceğini belirler.

Kısıtlı Donanım Bütçeleri için Tasarlandı

Cihaz üzerindeki ayak izi modelin temel satış noktasıdır. Google, niceleme ile EmbeddingGemma 2'nin yalnızca metin ağırlıkları için yaklaşık 191 MB kadar az aktif RAM ve Google Pixel 11 Pro'daki tam multimodal model için yaklaşık 567 MB kadar az aktif RAM gerektirdiğini bildiriyor. Bağlam penceresi ayrıca EmbeddingGemma 1'den dört kat daha büyük olan 8.000 jetona ulaştı; bu, tek geçişte 5,5 dakikaya kadar ses, 29 görüntü veya 58 video karesini veya bunların aralıklı kombinasyonlarını işlemeye yetecek kadar arttı.

Model, metin tokenizer'ını ve ses kodlayıcısını Gemma 4 ile paylaştığından, geliştiriciler EmbeddingGemma 2'yi Gemma 4 ile birlikte daha düşük bir birleşik bellek ayak izine sahip birleşik bir boru hattında çalıştırabilir ve hem alma hem de oluşturmanın yerel olarak gerçekleştiği cihaz içi RAG'yi etkinleştirebilir. Google bunu, yerel dosya alımını Gemma 4 bağlamsal akıl yürütmeyle eşleştirerek AI Edge Foresight uygulamasında gösteriyor.

Araçlar ve Kullanılabilirlik

Model, Google'ın AI Edge araçları aracılığıyla kullanılabilir. Google AI Edge Gallery uygulaması, metin veya resim sorgularındaki semantik benzerliğe göre kitaplık eşleşmelerini bulan Anında Medya Arama'yı ve metin veya ses sorgularını kullanarak belirli sahneleri bulan bir Video Anları Bulucu'yu sunar. Gerçek zamanlı sınıflandırma, yönlendirme ve tahmine dayalı kullanım örnekleri, MediaPipe Karar Görevi API'si aracılığıyla ortaya çıkıyor ve Google'ın AI Edge blogu, LiteRT ile cihaz içi arama ve RAG sistemlerinin nasıl oluşturulacağını belgeliyor. Tam değerlendirme ölçümleri model kartında mevcuttur.

Cihaz İçi Yerleştirmeler Neden Önemlidir

Gömme modelleri nadiren sınır sohbet modelleri gibi manşetlerde yer alır, ancak çoğu pratik AI özelliğinin altında yer alır: anlamsal arama, öneri, veri tekilleştirme, sınıflandırma ve RAG için erişim. Bunları yerel olarak çalıştırmak, gizlilik ve gecikme hesabını tamamen değiştirir. Veriler asla cihazdan ayrılmaz, sorgular çevrimdışı çalışır ve milyarlarca yerleşik cihaz ölçeğinde önemli olan arama başına API maliyeti yoktur.

EmbeddingGemma 2 aynı zamanda Google, Meta, Mistral ve bir grup küçük laboratuvarın kullanışlı yapay zekanın veri merkezi olmadan çalışabileceğini kanıtlamak için yarıştığı verimli açık model alanındaki rekabeti de yoğunlaştırıyor. Bir telefonda beş modaliteyi işleyen 740M parametreli bir model, bu yarışta dikkate değer bir işarettir. Önceki sürümün indirme gidişatı bir gösterge ise EmbeddingGemma 2'nin önümüzdeki aylarda geniş bir mobil ve uç ürün yelpazesinde görünmesini bekleyin.

Yapay Zeka Eğrisinin Önünde Kalın

Cihazdaki yapay zeka çoğu insanın düşündüğünden daha hızlı ilerliyor. Her büyük model lansmanı, karşılaştırma ve geliştirici aracı sürümünün kapsamı için aibuzzwire.news adresindeki en son AI haberlerini okuyun.

Daha fazla AI haberini okuyun →