Google запустив EmbeddingGemma 2, відкриту, легку модель вбудовування, яка нативно відображає комбінації тексту, зображень, аудіо та відео в єдиний уніфікований простір для вбудовування. Оголошення, опубліковане 6 жовтня 2026 року інженерами-дослідниками Google DeepMind Сахіл Дуа та Енріке Шехтер Вера, позиціонує модель із 740 мільйонами параметрів як найефективніший варіант для мультимодального вбудовування на пристрої, випущений за комерційно дозволеною ліцензією Apache 2.0 і побудований на архітектурі Gemma 4.
Перший EmbeddingGemma перевершив очікування Google, отримавши понад 20 мільйонів завантажень, які забезпечили інструменти пошуку на пристрої та конвеєри розширеної генерації для пошуку насамперед конфіденційності. Продовження викликало негайний інтерес розробників, викликавши одну з найбільших дискусій дня в Hacker News, коли розробники оцінювали, що означає один мультимодальний вбудований пристрій для локальних AI news програм, медіа-бібліотек і систем RAG, які ніколи не торкаються хмари.
Одна модель для тексту, коду, зображень, аудіо та відео
Головною можливістю EmbeddingGemma 2 є рідна мультимодальність. Замість того, щоб запускати окремі кодери для кожної модальності та об’єднувати результати разом, модель вбудовує комбінації тексту, коду, зображень, відео та аудіо в один спільний простір. Приклади Google включають пошук певного відеокліпу за допомогою голосового нагадування як запиту або пошук годин аудіозаписів із текстовою підказкою, усе це обробляється однією моделлю на локальному апаратному забезпеченні.
Архітектура модульна. Лише текстове ядро потребує лише 270 мільйонів параметрів, а додаткові кодери зображення (170 мільйонів параметрів) і аудіо (300 мільйонів параметрів) додають повну мультимодальну підтримку. Таким чином, розробники можуть розгорнути компактне текстове вбудовування вже сьогодні та перерости до повного мультимодального пошуку без зміни сімейств моделей.
Результати тестування та ефективність зберігання
Google повідомляє, що EmbeddingGemma 2 досягає провідних результатів серед мультимодальних інтеграторів sub-1B за тестами, включаючи код MTEB (Massive Text Embedding Benchmark) і MAEB (Massive Audio Embedding Benchmark), водночас збігаючись або перевершуючи багато більших моделей у текстових, візуальних та звукових завданнях. Найконкретніший приріст у коді: продуктивність коду MTEB підскочила на 9,92 пункту, з 68,76 до 78,68, що, за словами Google, робить модель добре придатною для індексування локальної кодової бази, семантичного пошуку коду та пошуку агентів кодування. Що стосується зображень, відео, документів і аудіо, компанія заявляє про новий стандарт якості за параметром для моделей під 1B, кажучи, що він навіть перевершує деякі спеціалізовані моделі більш ніж удвічі.
Ефективність зберігання походить від навчання представлення матрьошок (MRL). Вихідні вектори можна динамічно скорочувати з 768 розмірів до 512, 256 або 128 розмірів, забезпечуючи до 6-кратного зменшення обсягу пам’яті для локальних векторних баз даних і використання пам’яті. Для розробників, які запускають пошук на телефонах або вбудованому обладнанні, ця різниця часто визначає, чи постачатиметься функція взагалі.
Розроблено для обмежених апаратних бюджетів
Розташування на пристрої є основною перевагою моделі. З квантуванням Google повідомляє, що EmbeddingGemma 2 вимагає лише приблизно 191 МБ активної оперативної пам’яті для вагомості лише тексту та близько 567 МБ для повної мультимодальної моделі на Google Pixel 11 Pro. Контекстне вікно також зросло до 8000 токенів, що в чотири рази більше, ніж у EmbeddingGemma 1, достатньо для обробки до 5,5 хвилин аудіо, 29 зображень або 58 відеокадрів за один прохід або їх чергуваних комбінацій.
Оскільки ця модель має спільний текстовий токенізер і аудіокодер із Gemma 4, розробники можуть запускати EmbeddingGemma 2 разом із Gemma 4 в уніфікованому конвеєрі з меншим об’єднаним відбитком пам’яті, уможливлюючи RAG на пристрої, де як пошук, так і генерація відбуваються локально. Google демонструє це у своїй програмі AI Edge Foresight, поєднуючи пошук локальних файлів із контекстним обґрунтуванням Gemma 4.
Інструменти та доступність
Модель доступна через інструмент Google AI Edge. Додаток Google AI Edge Gallery демонструє миттєвий медіапошук, який знаходить бібліотечні збіги за семантичною схожістю на основі запитів тексту чи зображення, а також Finder Video Moments Finder, який знаходить певні сцени за допомогою текстових або аудіо запитів. Випадки класифікації, маршрутизації та прогнозування в реальному часі представлені через MediaPipe Decision Task API, а в блозі Google AI Edge описано, як створювати системи пошуку на пристрої та RAG за допомогою LiteRT. Повні показники оцінки доступні в картці моделі.
Чому вбудовування на пристрої важливі
Моделі вбудовування рідко потрапляють у заголовки, як моделі прикордонного чату, але вони лежать під більш практичними функціями ШІ: семантичний пошук, рекомендації, дедуплікація, класифікація та пошук для RAG. Їх локальний запуск повністю змінює обчислення конфіденційності та затримки. Дані ніколи не залишають пристрій, запити працюють в автономному режимі, а вартість API не стягується за виклик, що має значення в масштабі мільярдів вбудованих пристроїв.
EmbeddingGemma 2 також загострює конкуренцію в ефективному просторі відкритої моделі, де Google, Meta, Mistral і когорта менших лабораторій змагаються, щоб довести, що корисний ШІ може працювати без центру обробки даних. Модель із параметрами 740M, яка обробляє п’ять модальностей на телефоні, є помітним маркером у цій гонці. Якщо траєкторія завантаження його попередника є певним показником, очікуйте, що EmbeddingGemma 2 з’явиться в широкому діапазоні мобільних і периферійних продуктів протягом найближчих місяців.
Будьте попереду кривої ШІ
Штучний інтелект на пристрої розвивається швидше, ніж більшість людей усвідомлюють. Читайте останні новини штучного інтелекту на aibuzzwire.news, щоб дізнатися про кожну основну модель, тестування та випуск інструментів для розробників.
Читати більше новин AI →