Firma Google uruchomiła EmbeddingGemma 2, otwarty, lekki model osadzania, który natywnie mapuje kombinacje tekstu, obrazów, dźwięku i wideo w jedną, ujednoliconą przestrzeń do osadzania. Ogłoszenie opublikowane 6 października 2026 r. przez inżynierów badawczych Google DeepMind, Sahila Duę i Henrique Schechtera Verę, pozycjonuje model o 740 milionach parametrów jako najbardziej wydajną opcję multimodalnego osadzania na urządzeniu, wydany na komercyjnej licencji Apache 2.0 i zbudowany na architekturze Gemma 4.
Pierwsza aplikacja EmbeddingGemma przekroczyła oczekiwania Google – ponad 20 milionów pobrań zasilało narzędzia wyszukiwania na urządzeniach i potoki generacji rozszerzonej zapewniające pobieranie na pierwszym miejscu prywatności. Kontynuacja natychmiast wzbudziła zainteresowanie programistów, wywołując jedną z największych dyskusji dzisiejszego dnia w Hacker News, podczas których twórcy oceniali, co oznacza pojedynczy wielomodalny moduł osadzający dla lokalnych aplikacji [wiadomości AI] (https://aibuzzwire.news), bibliotek multimediów i systemów RAG, które nigdy nie dotykają chmury.
Jeden model dla tekstu, kodu, obrazów, dźwięku i wideo
Główną funkcją EmbeddingGemma 2 jest natywna multimodalność. Zamiast uruchamiać oddzielne kodery dla każdej modalności i łączyć wyniki, model osadza kombinacje tekstu, kodu, obrazów, wideo i audio w jedną wspólną przestrzeń. Przykłady Google obejmują wyszukiwanie określonego klipu wideo przy użyciu notatki głosowej jako zapytania lub przeszukiwanie godzin nagrań dźwiękowych za pomocą podpowiedzi tekstowej, a wszystko to przetwarzane jest przez jeden model na lokalnym sprzęcie.
Architektura jest modułowa. Rdzeń tekstowy wymaga zaledwie 270 milionów parametrów, a opcjonalne kodery wizyjne (170 milionów parametrów) i audio (300 milionów parametrów) zapewniają pełną obsługę multimodalną. Dlatego programiści mogą już dziś wdrożyć kompaktowy moduł do osadzania tekstu i przejść do pełnego wyszukiwania multimodalnego bez zmiany rodzin modeli.
Wyniki testów porównawczych i wydajność przechowywania
Google podaje, że EmbeddingGemma 2 osiąga czołowe wyniki wśród multimodalnych osadzaczy poniżej 1 miliarda w testach porównawczych, w tym MTEB (Massive Text Embedding Benchmark) Code i MAEB (Massive Audio Embedding Benchmark), jednocześnie dorównując lub przewyższając wiele większych modeli w zadaniach związanych z tekstem, obrazem i dźwiękiem. Najbardziej konkretny wzrost dotyczy kodu: wydajność kodu MTEB wzrosła o 9,92 punktu, z 68,76 do 78,68, co według Google sprawia, że model dobrze nadaje się do indeksowania lokalnej bazy kodu, semantycznego wyszukiwania kodu i wyszukiwania agentów kodujących. W zakresie obrazu, wideo, dokumentów i dźwięku firma ustanawia nowy standard jakości na parametr dla modeli poniżej 1B, twierdząc, że przewyższa nawet niektóre specjalistyczne modele ponad dwukrotnie większymi rozmiarami.
Wydajność przechowywania wynika z uczenia się reprezentacji Matryoshki (MRL). Wektory wyjściowe można dynamicznie obcinać z 768 wymiarów do 512, 256 lub 128 wymiarów, co zapewnia nawet 6-krotną redukcję pamięci dla lokalnych baz danych wektorowych i zużycia pamięci. W przypadku programistów uruchamiających pobieranie na telefonach lub sprzęcie wbudowanym różnica ta często decyduje o tym, czy dana funkcja w ogóle zostanie dostarczona.
Zaprojektowany z myślą o napiętych budżetach sprzętowych
Zasięg urządzenia jest główną zaletą modelu. Google informuje, że w przypadku kwantyzacji EmbeddingGemma 2 wymaga zaledwie około 191 MB aktywnej pamięci RAM w przypadku wag tekstowych i około 567 MB w przypadku pełnego modelu multimodalnego w Google Pixel 11 Pro. Okno kontekstowe również rozrosło się do 8000 tokenów, czyli czterokrotnie więcej niż EmbeddingGemma 1, co wystarcza do przetworzenia do 5,5 minuty dźwięku, 29 obrazów lub 58 klatek wideo w jednym przebiegu lub przeplatanej ich kombinacji.
Ponieważ model współdzieli tokenizator tekstu i koder audio z Gemma 4, programiści mogą uruchomić EmbeddingGemma 2 wraz z Gemma 4 w ujednoliconym potoku przy mniejszym łącznym zużyciu pamięci, umożliwiając RAG na urządzeniu, gdzie pobieranie i generowanie odbywa się lokalnie. Google demonstruje to w swojej aplikacji AI Edge Foresight, łącząc lokalne pobieranie plików z rozumowaniem kontekstowym Gemma 4.
Narzędzia i dostępność
Model jest dostępny za pośrednictwem narzędzi Google AI Edge. Aplikacja Google AI Edge Gallery udostępnia funkcję Instant Media Search, która wyszukuje dopasowania bibliotek na podstawie podobieństwa semantycznego na podstawie zapytań tekstowych lub graficznych, a także funkcję Video Moments Finder, która lokalizuje określone sceny za pomocą zapytań tekstowych lub dźwiękowych. Klasyfikacja, routing i predykcyjne przypadki użycia w czasie rzeczywistym są udostępniane za pośrednictwem interfejsu API zadań decyzyjnych MediaPipe, a blog Google AI Edge dokumentuje, jak tworzyć systemy wyszukiwania i RAG na urządzeniu za pomocą LiteRT. Pełne wskaźniki oceny są dostępne na karcie modelu.
Dlaczego osadzanie na urządzeniu ma znaczenie
Modele osadzające rzadko trafiają na pierwsze strony gazet, tak jak robią to modele czatów z frontu, ale znajdują się pod najbardziej praktycznymi funkcjami sztucznej inteligencji: wyszukiwaniem semantycznym, rekomendacjami, deduplikacją, klasyfikacją i wyszukiwaniem dla RAG. Uruchamianie ich lokalnie całkowicie zmienia rachunek prywatności i opóźnień. Dane nigdy nie opuszczają urządzenia, zapytania działają w trybie offline i nie ma kosztów API za połączenie, co ma znaczenie w skali miliardów urządzeń wbudowanych.
EmbeddingGemma 2 intensyfikuje także konkurencję w wydajnej przestrzeni modelu otwartego, w której Google, Meta, Mistral i grupa mniejszych laboratoriów ścigają się, aby udowodnić, że użyteczna sztuczna inteligencja może działać bez centrum danych. Model o parametrach 740M obsługujący pięć trybów telefonu jest godnym uwagi punktem w tym wyścigu. Jeśli ścieżka pobierania poprzedniej wersji jest jakąkolwiek wskazówką, należy się spodziewać, że w nadchodzących miesiącach EmbeddingGemma 2 pojawi się w szerokiej gamie produktów mobilnych i brzegowych.
Wyprzedź krzywą sztucznej inteligencji
Sztuczna inteligencja na urządzeniach rozwija się szybciej, niż większość ludzi zdaje sobie sprawę. Przeczytaj najnowsze wiadomości o sztucznej inteligencji na aibuzzwire.news, aby zapoznać się z informacjami o wszystkich najważniejszych premierach modeli, testach porównawczych i wydaniach narzędzi dla programistów.
Przeczytaj więcej aktualności o sztucznej inteligencji →