Google은 텍스트, 이미지, 오디오 및 비디오의 조합을 단일 통합 임베딩 공간에 기본적으로 매핑하는 개방형 경량 임베딩 모델인 EmbeddingGemma 2를 출시했습니다. Google DeepMind 연구 엔지니어인 Sahil Dua와 Henrique Schechter Vera가 2026년 10월 6일에 게시한 발표에서는 7억 4천만 개의 매개변수 모델이 상업적으로 허용되는 Apache 2.0 라이선스에 따라 출시되고 Gemma 4 아키텍처를 기반으로 구축된 온디바이스 다중 모달 임베딩을 위한 가장 유능한 옵션으로 자리 잡았습니다.
첫 번째 EmbeddingGemma는 기기 내 검색 도구와 개인 정보 보호 우선 검색 증강 생성 파이프라인을 지원하는 2천만 건 이상의 다운로드로 Google의 기대치를 뛰어넘었습니다. 속편은 즉각적인 개발자의 관심을 불러일으켰고, 빌더들이 클라우드에 전혀 영향을 주지 않는 로컬 AI 뉴스 앱, 미디어 라이브러리 및 RAG 시스템에 단일 다중 모달 임베더가 무엇을 의미하는지 평가하면서 당일 최대 규모의 Hacker News 토론 중 하나를 이끌어 냈습니다.
텍스트, 코드, 이미지, 오디오 및 비디오를 위한 단일 모델
EmbeddingGemma 2의 헤드라인 기능은 기본 다중 모드입니다. 양식별로 별도의 인코더를 실행하고 결과를 함께 연결하는 대신 모델은 텍스트, 코드, 이미지, 비디오 및 오디오의 조합을 하나의 공유 공간에 포함합니다. Google의 예에는 음성 메모를 쿼리로 사용하여 특정 비디오 클립을 찾거나 텍스트 프롬프트로 몇 시간 분량의 오디오 녹음을 검색하는 것이 포함되며 모두 로컬 하드웨어의 단일 모델로 처리됩니다.
아키텍처는 모듈식입니다. 텍스트 전용 코어에는 2억 7천만 개의 매개변수가 필요하며 옵션인 비전(1억 7천만 매개변수) 및 오디오(3억 매개변수) 인코더는 완전한 멀티모달 지원을 추가합니다. 따라서 개발자는 지금 컴팩트 텍스트 임베더를 배포하고 모델 계열을 변경하지 않고도 완전한 다중 모드 검색으로 성장할 수 있습니다.
벤치마크 결과 및 스토리지 효율성
Google은 EmbeddingGemma 2가 MTEB(Massive Text Embedding Benchmark) 코드 및 MAEB(Massive Audio Embedding Benchmark)를 포함한 벤치마크에서 1B 미만 다중 모달 임베더 중 최고의 점수를 달성하는 동시에 텍스트, 비전 및 오디오 작업 전반에 걸쳐 많은 대형 모델과 일치하거나 그보다 뛰어난 성능을 발휘한다고 보고합니다. 가장 구체적인 이득은 코드에 있습니다. MTEB 코드 성능은 68.76에서 78.68로 9.92포인트 증가했습니다. Google은 이를 통해 이 모델이 로컬 코드베이스 인덱싱, 의미 체계 코드 검색 및 코딩 에이전트 검색에 매우 적합하다고 말합니다. 이미지, 비디오, 문서 및 오디오 전반에 걸쳐 회사는 1B 미만 모델에 대한 매개변수당 품질의 새로운 표준을 주장하며 크기가 두 배 이상인 일부 전문 모델보다 성능이 뛰어나다고 말합니다.
스토리지 효율성은 MRL(Matryoshka Representation Learning)에서 비롯됩니다. 출력 벡터는 768차원에서 512, 256 또는 128차원으로 동적으로 잘라낼 수 있어 로컬 벡터 데이터베이스 및 메모리 사용량에 대한 스토리지를 최대 6배까지 줄일 수 있습니다. 휴대폰이나 내장된 하드웨어에서 검색을 실행하는 개발자의 경우 이러한 차이가 기능 제공 여부를 결정하는 경우가 많습니다.
빠듯한 하드웨어 예산에 맞춰 설계됨
기기 내 설치 공간은 모델의 핵심 판매 포인트입니다. 양자화를 통해 Google은 EmbeddingGemma 2가 텍스트 전용 가중치의 경우 약 191MB의 활성 RAM이 필요하고 Google Pixel 11 Pro의 전체 다중 모드 모델의 경우 약 567MB가 필요하다고 보고합니다. 또한 컨텍스트 창은 EmbeddingGemma 1보다 4배 더 큰 8,000개의 토큰으로 증가하여 단일 패스에서 최대 5.5분의 오디오, 29개의 이미지 또는 58개의 비디오 프레임 또는 인터리브 조합을 처리할 수 있습니다.
모델이 텍스트 토크나이저 및 오디오 인코더를 Gemma 4와 공유하기 때문에 개발자는 결합된 메모리 공간이 더 적은 통합 파이프라인에서 Gemma 4와 함께 EmbeddingGemma 2를 실행할 수 있으며 검색과 생성이 모두 로컬에서 발생하는 기기 내 RAG를 활성화할 수 있습니다. Google은 로컬 파일 검색과 Gemma 4 상황별 추론을 결합하여 AI Edge Foresight 앱에서 이를 시연합니다.
도구 및 가용성
이 모델은 Google의 AI Edge 도구를 통해 사용할 수 있습니다. Google AI Edge Gallery 앱은 텍스트 또는 이미지 쿼리의 의미적 유사성에 따라 라이브러리 일치를 찾는 인스턴트 미디어 검색과 텍스트 또는 오디오 쿼리를 사용하여 특정 장면을 찾는 Video Moments Finder를 선보입니다. 실시간 분류, 라우팅 및 예측 사용 사례는 MediaPipe Decision Task API를 통해 노출되며 Google의 AI Edge 블로그에는 LiteRT를 사용하여 기기 내 검색 및 RAG 시스템을 구축하는 방법이 문서되어 있습니다. 전체 평가 측정항목은 모델 카드에서 확인할 수 있습니다.
기기 내 임베딩이 중요한 이유
임베딩 모델은 프론티어 채팅 모델처럼 헤드라인을 장식하는 경우가 거의 없지만 의미론적 검색, 추천, 중복 제거, 분류 및 RAG 검색과 같은 가장 실용적인 AI 기능의 기반이 됩니다. 로컬에서 실행하면 개인 정보 보호 및 대기 시간 계산이 완전히 변경됩니다. 데이터가 장치를 떠나지 않고, 쿼리가 오프라인으로 작동하며, 수십억 개의 임베디드 장치 규모에서 중요한 호출별 API 비용이 없습니다.
EmbeddingGemma 2는 또한 Google, Meta, Mistral 및 소규모 연구소가 유용한 AI가 데이터 센터 없이 실행될 수 있음을 증명하기 위해 경쟁하고 있는 효율적인 개방형 모델 공간에서 경쟁을 강화합니다. 휴대폰에서 5가지 양식을 처리하는 740M 매개변수 모델은 해당 경쟁에서 주목할만한 지표입니다. 이전 버전의 다운로드 궤적을 보면 EmbeddingGemma 2가 앞으로 몇 달 동안 광범위한 모바일 및 엣지 제품에 나타날 것으로 예상됩니다.
AI 곡선에서 앞서 나가세요
온디바이스 AI는 대부분의 사람들이 생각하는 것보다 빠르게 발전하고 있습니다. 모든 주요 모델 출시, 벤치마크 및 개발자 도구 출시에 대한 내용을 보려면 aibuzzwire.news에서 최신 AI 뉴스를 읽어보세요.
AI 뉴스 자세히 보기 →