Google запустил EmbeddingGemma 2, открытую и легкую модель внедрения, которая естественным образом отображает комбинации текста, изображений, аудио и видео в единое унифицированное пространство для внедрения. В объявлении, опубликованном 6 октября 2026 года инженерами-исследователями Google DeepMind Сахилом Дуа и Энрике Шехтером Вера, модель с 740 миллионами параметров позиционируется как наиболее подходящий вариант для мультимодального внедрения на устройстве, выпущенный под коммерчески разрешительной лицензией Apache 2.0 и построенный на архитектуре Gemma 4.
Первая EmbeddingGemma превзошла ожидания Google: более 20 миллионов загрузок обеспечили работу встроенных в устройство инструментов поиска и конвейеров расширенной генерации поиска, ориентированных на конфиденциальность. Продолжение вызвало немедленный интерес разработчиков, вызвав одну из крупнейших дискуссий Hacker News за день, когда разработчики оценивали, что означает одно мультимодальное средство внедрения для локальных AI news приложений, медиа-библиотек и систем RAG, которые никогда не касаются облака.
Одна модель для текста, кода, изображений, аудио и видео
Главной особенностью EmbeddingGemma 2 является нативная мультимодальность. Вместо того, чтобы запускать отдельные кодировщики для каждой модальности и объединять результаты, модель встраивает комбинации текста, кода, изображений, видео и аудио в одно общее пространство. Примеры Google включают поиск определенного видеоклипа с использованием голосовой заметки в качестве запроса или поиск часов аудиозаписей с текстовой подсказкой, и все это обрабатывается одной моделью на локальном оборудовании.
Архитектура модульная. Для текстового ядра требуется всего 270 миллионов параметров, а дополнительные видеокодеры (170 миллионов параметров) и аудио (300 миллионов параметров) добавляют полную мультимодальную поддержку. Таким образом, разработчики могут уже сегодня развернуть компактное средство для внедрения текста и перейти к полноценному мультимодальному поиску без изменения семейств моделей.
Результаты тестов и эффективность хранения данных
Google сообщает, что EmbeddingGemma 2 достигает лучших результатов среди мультимодальных программ для внедрения суб-1B в тестах, включая код MTEB (Massive Text Embedding Benchmark) и MAEB (Massive Audio Embedding Benchmark), при этом сопоставляя или превосходя многие более крупные модели в задачах с текстом, визуальным представлением и аудио. Самый конкретный прирост наблюдается в коде: производительность кода MTEB подскочила на 9,92 балла, с 68,76 до 78,68, что, по словам Google, делает модель хорошо подходящей для индексации локальной кодовой базы, семантического поиска кода и извлечения агента кодирования. Что касается изображения, видео, документов и аудио, компания заявляет о новом стандарте качества каждого параметра для моделей ниже 1B, заявляя, что он даже превосходит некоторые специализированные модели более чем в два раза больше своего размера.
Эффективность хранения достигается благодаря обучению представлению матрешек (MRL). Выходные векторы могут быть динамически усечены с 768 измерений до 512, 256 или 128 измерений, обеспечивая до 6-кратного сокращения объема памяти для локальных баз данных векторов и использования памяти. Для разработчиков, использующих поиск на телефонах или встроенном оборудовании, эта разница часто определяет, будет ли функция вообще реализована.
Разработан для ограниченного бюджета на оборудование
Размер на устройстве — это основной аргумент в пользу модели. Google сообщает, что с учетом квантования EmbeddingGemma 2 требуется всего лишь примерно 191 МБ активной оперативной памяти для весов только текста и около 567 МБ для полной мультимодальной модели на Google Pixel 11 Pro. Контекстное окно также выросло до 8000 токенов, что в четыре раза больше, чем у EmbeddingGemma 1, и этого достаточно для обработки до 5,5 минут аудио, 29 изображений или 58 видеокадров за один проход или их чередующихся комбинаций.
Поскольку модель использует тот же текстовый токенизатор и аудиокодер, что и Gemma 4, разработчики могут запускать EmbeddingGemma 2 вместе с Gemma 4 в едином конвейере с меньшим совокупным объемом памяти, что позволяет использовать RAG на устройстве, где извлечение и генерация происходят локально. Google демонстрирует это в своем приложении AI Edge Foresight, сочетая локальный поиск файлов с контекстным рассуждением Gemma 4.
Оснастка и доступность
Модель доступна через инструмент Google AI Edge. Приложение Google AI Edge Gallery демонстрирует мгновенный поиск мультимедиа, который находит совпадения в библиотеке по семантическому сходству на основе текстовых или графических запросов, а также инструмент поиска видеомоментов, который находит определенные сцены с помощью текстовых или аудиозапросов. Классификация, маршрутизация и прогнозное использование в реальном времени предоставляются через API задач принятия решений MediaPipe, а в блоге Google AI Edge документируется, как создавать системы поиска на устройстве и системы RAG с помощью LiteRT. Полные показатели оценки доступны в карточке модели.
Почему важно встраивание на устройство
Встраиваемые модели редко попадают в заголовки газет, как модели пограничных чатов, но они лежат в основе большинства практических функций ИИ: семантического поиска, рекомендаций, дедупликации, классификации и извлечения для RAG. Их локальный запуск полностью меняет расчеты конфиденциальности и задержки. Данные никогда не покидают устройство, запросы работают в автономном режиме, а стоимость API за вызов не взимается, что важно в масштабах миллиардов встроенных устройств.
EmbeddingGemma 2 также усиливает конкуренцию в эффективном пространстве открытой модели, где Google, Meta, Mistral и группа небольших лабораторий спешат доказать, что полезный ИИ может работать без центра обработки данных. Модель с 740 миллионами параметров, поддерживающая пять модальностей на телефоне, является заметным маркером в этой гонке. Если траектория загрузки его предшественника является каким-либо показателем, ожидайте, что EmbeddingGemma 2 появится в широком спектре мобильных и периферийных продуктов в ближайшие месяцы.
Будьте на шаг впереди ИИ
Искусственный интеллект на устройствах развивается быстрее, чем думает большинство людей. Прочитайте последние новости об искусственном интеллекте на aibuzzwire.news, чтобы узнать о запуске всех основных моделей, тестах и выпусках инструментов для разработчиков.
Читать больше новостей об искусственном интеллекте →