Google đã ra mắt EmbeddingGemma 2, một mô hình nhúng mở, nhẹ, giúp ánh xạ các tổ hợp văn bản, hình ảnh, âm thanh và video vào một không gian nhúng thống nhất duy nhất. Thông báo, được đăng vào ngày 6 tháng 10 năm 2026 bởi các kỹ sư nghiên cứu Sahil Dua và Henrique Schechter Vera của Google DeepMind, đã định vị mô hình 740 triệu tham số là tùy chọn có khả năng nhất để nhúng đa phương thức trên thiết bị, được phát hành theo giấy phép Apache 2.0 được cho phép về mặt thương mại và được xây dựng trên kiến trúc Gemma 4.
EmbeddingGemma đầu tiên đã vượt quá mong đợi của Google, với hơn 20 triệu lượt tải xuống hỗ trợ các công cụ tìm kiếm trên thiết bị và quy trình tạo tăng cường truy xuất ưu tiên quyền riêng tư. Phần tiếp theo đã thu hút sự quan tâm ngay lập tức của nhà phát triển, thu hút một trong những cuộc thảo luận về Hacker News lớn nhất trong ngày khi các nhà xây dựng đánh giá ý nghĩa của một trình nhúng đa phương thức duy nhất đối với các ứng dụng AI news, thư viện phương tiện và hệ thống RAG cục bộ không bao giờ chạm vào đám mây.
Một mô hình cho văn bản, mã, hình ảnh, âm thanh và video
Khả năng tiêu biểu của EmbeddingGemma 2 là tính đa phương thức gốc. Thay vì chạy các bộ mã hóa riêng biệt cho mỗi phương thức và ghép các kết quả lại với nhau, mô hình này sẽ nhúng các tổ hợp văn bản, mã, hình ảnh, video và âm thanh vào một không gian chung. Các ví dụ của Google bao gồm tìm một video clip cụ thể bằng cách sử dụng bản ghi nhớ giọng nói làm truy vấn hoặc tìm kiếm hàng giờ ghi âm bằng lời nhắc văn bản, tất cả đều được xử lý bởi một mô hình duy nhất trên phần cứng cục bộ.
Kiến trúc là mô-đun. Lõi chỉ có văn bản yêu cầu ít nhất là 270 triệu tham số, với bộ mã hóa hình ảnh tùy chọn (170 triệu tham số) và âm thanh (300 triệu tham số) bổ sung hỗ trợ đa phương thức đầy đủ. Do đó, các nhà phát triển có thể triển khai một trình nhúng văn bản nhỏ gọn ngay hôm nay và phát triển thành khả năng truy xuất đa phương thức đầy đủ mà không cần thay đổi họ mô hình.
Kết quả benchmark và hiệu quả lưu trữ
Google báo cáo rằng EmbeddingGemma 2 đạt được điểm số cao nhất trong số các trình nhúng đa phương thức dưới 1B trên các điểm chuẩn bao gồm Mã MTEB (Điểm chuẩn nhúng văn bản lớn) và MAEB (Điểm chuẩn nhúng âm thanh lớn), đồng thời khớp hoặc vượt trội hơn nhiều mô hình lớn hơn trên các tác vụ văn bản, hình ảnh và âm thanh. Mức tăng cụ thể nhất là ở mã: Hiệu suất mã MTEB tăng 9,92 điểm, từ 68,76 lên 78,68, Google cho biết điều này làm cho mô hình này rất phù hợp với lập chỉ mục cơ sở mã cục bộ, tìm kiếm mã ngữ nghĩa và truy xuất tác nhân mã hóa. Trên hình ảnh, video, tài liệu và âm thanh, công ty tuyên bố một tiêu chuẩn mới về chất lượng trên mỗi tham số cho các mẫu dưới 1B, cho biết nó thậm chí còn vượt trội hơn một số mẫu chuyên dụng có kích thước lớn hơn gấp đôi.
Hiệu quả lưu trữ đến từ Học tập biểu diễn Matryoshka (MRL). Các vectơ đầu ra có thể được cắt bớt động từ 768 chiều xuống còn 512, 256 hoặc 128 chiều, giúp giảm tới 6 lần dung lượng lưu trữ cho cơ sở dữ liệu vectơ cục bộ và mức sử dụng bộ nhớ. Đối với các nhà phát triển đang chạy truy xuất trên điện thoại hoặc phần cứng nhúng, sự khác biệt đó thường quyết định liệu một tính năng có được cung cấp hay không.
Được thiết kế cho ngân sách phần cứng eo hẹp
Dấu chân trên thiết bị là điểm bán hàng cốt lõi của mô hình. Với lượng tử hóa, Google báo cáo rằng EmbeddingGemma 2 yêu cầu ít nhất khoảng 191 MB RAM hoạt động cho trọng lượng chỉ văn bản và khoảng 567 MB cho kiểu máy đa phương thức đầy đủ trên Google Pixel 11 Pro. Cửa sổ ngữ cảnh cũng đã tăng lên 8.000 mã thông báo, lớn hơn bốn lần so với EmbeddingGemma 1, đủ để xử lý tối đa 5,5 phút âm thanh, 29 hình ảnh hoặc 58 khung hình video trong một lần truyền hoặc kết hợp xen kẽ chúng.
Vì mô hình này chia sẻ bộ mã hóa văn bản và bộ mã hóa âm thanh với Gemma 4 nên các nhà phát triển có thể chạy EmbeddingGemma 2 cùng với Gemma 4 trong một quy trình hợp nhất với mức sử dụng bộ nhớ kết hợp thấp hơn, cho phép RAG trên thiết bị trong đó cả việc truy xuất và tạo đều diễn ra cục bộ. Google chứng minh điều này trong ứng dụng AI Edge Foresight của mình, kết hợp việc truy xuất tệp cục bộ với khả năng suy luận theo ngữ cảnh của Gemma 4.
Công cụ và tính sẵn có
Mô hình này có sẵn thông qua công cụ AI Edge của Google. Ứng dụng Thư viện Google AI Edge giới thiệu tính năng Tìm kiếm phương tiện tức thì, tính năng này tìm thấy các kết quả trùng khớp trong thư viện theo sự giống nhau về ngữ nghĩa từ các truy vấn văn bản hoặc hình ảnh và Trình tìm kiếm khoảnh khắc video giúp định vị các cảnh cụ thể bằng cách sử dụng truy vấn văn bản hoặc âm thanh. Các trường hợp sử dụng phân loại, định tuyến và dự đoán theo thời gian thực được thể hiện thông qua API nhiệm vụ quyết định MediaPipe và blog AI Edge của Google ghi lại cách xây dựng hệ thống RAG và tìm kiếm trên thiết bị bằng LiteRT. Số liệu đánh giá đầy đủ có sẵn trong thẻ mô hình.
Tại sao việc nhúng trên thiết bị lại quan trọng
Các mô hình nhúng hiếm khi gây chú ý theo cách mà các mô hình trò chuyện biên giới thực hiện, nhưng chúng nằm bên dưới hầu hết các tính năng AI thực tế: tìm kiếm ngữ nghĩa, đề xuất, loại bỏ trùng lặp, phân loại và truy xuất cho RAG. Việc chạy chúng cục bộ sẽ thay đổi hoàn toàn phép tính về quyền riêng tư và độ trễ. Dữ liệu không bao giờ rời khỏi thiết bị, các truy vấn hoạt động ngoại tuyến và không có chi phí API cho mỗi cuộc gọi, điều này quan trọng ở quy mô hàng tỷ thiết bị nhúng.
EmbeddingGemma 2 cũng tăng cường cạnh tranh trong không gian mô hình mở hiệu quả, nơi Google, Meta, Mistral và một nhóm các phòng thí nghiệm nhỏ hơn đang chạy đua để chứng minh rằng AI hữu ích có thể chạy mà không cần trung tâm dữ liệu. Mô hình tham số 740M xử lý năm phương thức trên điện thoại là điểm đánh dấu đáng chú ý trong cuộc đua đó. Nếu quỹ đạo tải xuống của phiên bản tiền nhiệm là bất kỳ dấu hiệu nào, hãy kỳ vọng EmbeddingGemma 2 sẽ xuất hiện trong một loạt sản phẩm di động và thiết bị biên trong những tháng tới.
Đi trước đường cong AI
AI trên thiết bị đang phát triển nhanh hơn hầu hết mọi người nhận ra. Đọc tin tức AI mới nhất trên aibuzzwire.news để biết thông tin về mọi lần ra mắt mô hình chính, điểm chuẩn và bản phát hành công cụ dành cho nhà phát triển.
Đọc thêm tin tức về AI →