Google เปิดตัว EmbeddingGemma 2 ซึ่งเป็นโมเดลการฝังแบบเปิดน้ำหนักเบาที่จับคู่การผสมผสานระหว่างข้อความ รูปภาพ เสียง และวิดีโอลงในพื้นที่การฝังที่เป็นหนึ่งเดียว การประกาศดังกล่าวโพสต์เมื่อวันที่ 6 ตุลาคม 2569 โดย Sahil Dua และ Henrique Schechter Vera วิศวกรวิจัยของ Google DeepMind วางตำแหน่งโมเดลขนาด 740 ล้านพารามิเตอร์ให้เป็นตัวเลือกที่มีความสามารถมากที่สุดสำหรับการฝังหลายรูปแบบบนอุปกรณ์ เปิดตัวภายใต้ใบอนุญาต Apache 2.0 ที่ได้รับอนุญาตในเชิงพาณิชย์ และสร้างบนสถาปัตยกรรม Gemma 4

EmbeddingGemma ครั้งแรกนั้นเกินความคาดหมายของ Google โดยมีการดาวน์โหลดมากกว่า 20 ล้านครั้งซึ่งขับเคลื่อนเครื่องมือค้นหาในอุปกรณ์และไปป์ไลน์การสร้างข้อมูลที่เน้นความเป็นส่วนตัวเป็นหลัก ภาคต่อนี้สร้างความสนใจให้กับนักพัฒนาในทันที โดยดึงเอาหนึ่งในการอภิปราย Hacker News ครั้งใหญ่ที่สุดในแต่ละวัน ในขณะที่ผู้สร้างประเมินว่าการฝังแบบหลายรูปแบบเดียวมีความหมายอย่างไรต่อแอป AI news ท้องถิ่น ไลบรารีสื่อ และระบบ RAG ที่ไม่เคยแตะต้องระบบคลาวด์

โมเดลเดียวสำหรับข้อความ โค้ด รูปภาพ เสียง และวิดีโอ

ความสามารถพาดหัวของ EmbeddingGamma 2 นั้นมีหลากหลายรูปแบบ แทนที่จะใช้ตัวเข้ารหัสแยกกันตามรูปแบบและต่อผลลัพธ์เข้าด้วยกัน โมเดลจะฝังการผสมผสานระหว่างข้อความ โค้ด รูปภาพ วิดีโอ และเสียงลงในพื้นที่ที่ใช้ร่วมกันแห่งเดียว ตัวอย่างของ Google ได้แก่ การค้นหาคลิปวิดีโอที่ต้องการโดยใช้บันทึกเสียงเป็นแบบสอบถาม หรือการค้นหาชั่วโมงของการบันทึกเสียงด้วยข้อความแจ้ง ทั้งหมดนี้ประมวลผลโดยโมเดลเดียวบนฮาร์ดแวร์ในเครื่อง

สถาปัตยกรรมเป็นแบบโมดูลาร์ แกนข้อความอย่างเดียวต้องการพารามิเตอร์เพียง 270 ล้านพารามิเตอร์ พร้อมด้วยตัวเข้ารหัสการมองเห็น (170 ล้านพารามิเตอร์) และเสียง (300 ล้านพารามิเตอร์) ที่เป็นตัวเลือกซึ่งเพิ่มการรองรับหลายรูปแบบเต็มรูปแบบ นักพัฒนาจึงสามารถปรับใช้ตัวฝังข้อความขนาดกะทัดรัดได้แล้ววันนี้ และขยายไปสู่การดึงข้อมูลหลายรูปแบบเต็มรูปแบบโดยไม่ต้องเปลี่ยนตระกูลโมเดล

ผลลัพธ์มาตรฐานและประสิทธิภาพการจัดเก็บ

Google รายงานว่า EmbeddingGemma 2 บรรลุคะแนนนำในกลุ่ม sub-1B multimodal embedder ในการวัดประสิทธิภาพ รวมถึงโค้ด MTEB (Massive Text Embedding Benchmark) และ MAEB (Massive Audio Embedding Benchmark) ในขณะที่จับคู่หรือมีประสิทธิภาพเหนือกว่าโมเดลขนาดใหญ่จำนวนมากในงานข้อความ การแสดงภาพ และเสียง สิ่งที่ได้รับอย่างเป็นรูปธรรมมากที่สุดคือโค้ด: ประสิทธิภาพของโค้ด MTEB เพิ่มขึ้น 9.92 จุด จาก 68.76 เป็น 78.68 ซึ่ง Google กล่าวว่าทำให้โมเดลนี้เหมาะสมกับการจัดทำดัชนีโค้ดเบสในพื้นที่ การค้นหาโค้ดความหมาย และการดึงข้อมูลเอเจนต์การเขียนโค้ด ในด้านภาพ วิดีโอ เอกสาร และเสียง บริษัทอ้างมาตรฐานใหม่ในคุณภาพต่อพารามิเตอร์สำหรับรุ่น sub-1B โดยกล่าวว่ามีประสิทธิภาพเหนือกว่ารุ่นพิเศษบางรุ่นมากกว่าขนาดสองเท่าด้วยซ้ำ

ประสิทธิภาพพื้นที่เก็บข้อมูลมาจาก Matryoshka Representation Learning (MRL) เวกเตอร์เอาต์พุตสามารถตัดทอนแบบไดนามิกจากขนาด 768 เหลือขนาด 512, 256 หรือ 128 ซึ่งช่วยลดพื้นที่จัดเก็บได้ถึง 6 เท่าสำหรับฐานข้อมูลเวกเตอร์ในเครื่องและการใช้งานหน่วยความจำ สำหรับนักพัฒนาที่รันการดึงข้อมูลบนโทรศัพท์หรือฮาร์ดแวร์แบบฝัง ความแตกต่างนั้นมักจะเป็นตัวกำหนดว่าฟีเจอร์จะจัดส่งหรือไม่

ออกแบบมาสำหรับงบประมาณด้านฮาร์ดแวร์ที่จำกัด

รอยเท้าบนอุปกรณ์เป็นจุดขายหลักของรุ่น ด้วยการวัดปริมาณ Google รายงานว่า EmbeddingGemma 2 ต้องการ RAM ที่ใช้งานอยู่เพียงประมาณ 191MB สำหรับน้ำหนักแบบข้อความเท่านั้น และประมาณ 567MB สำหรับรุ่นมัลติโมดัลเต็มรูปแบบบน Google Pixel 11 Pro หน้าต่างบริบทยังเพิ่มขึ้นเป็น 8,000 โทเค็น ซึ่งใหญ่กว่า EmbeddingGemma 1 ถึงสี่เท่า ซึ่งเพียงพอที่จะประมวลผลเสียงสูงสุด 5.5 นาที, 29 ภาพ หรือ 58 เฟรมวิดีโอในการส่งผ่านครั้งเดียว หรือการผสมผสานระหว่างหน้าต่างบริบท

เนื่องจากโมเดลแชร์โทเค็นข้อความและตัวเข้ารหัสเสียงกับ Gemma 4 นักพัฒนาจึงสามารถรัน EmbeddingGemma 2 ควบคู่ไปกับ Gemma 4 ในไปป์ไลน์แบบครบวงจรที่มีขนาดหน่วยความจำรวมที่ต่ำกว่า ช่วยให้ RAG บนอุปกรณ์ซึ่งการดึงข้อมูลและการสร้างเกิดขึ้นภายในเครื่อง Google สาธิตสิ่งนี้ในแอป AI Edge Foresight โดยจับคู่การดึงไฟล์ในเครื่องกับการให้เหตุผลเชิงบริบทของ Gemma 4

เครื่องมือและความพร้อมใช้งาน

โมเดลนี้มีให้ใช้งานผ่านเครื่องมือ AI Edge ของ Google แอป Google AI Edge Gallery นำเสนอ Instant Media Search ซึ่งค้นหาการจับคู่ไลบรารีตามความหมายที่คล้ายคลึงกันจากการสืบค้นข้อความหรือรูปภาพ และตัวค้นหาช่วงเวลาวิดีโอที่ค้นหาฉากเฉพาะโดยใช้ข้อความหรือเสียงสืบค้น กรณีการใช้งานการจำแนกประเภท การกำหนดเส้นทาง และการคาดการณ์แบบเรียลไทม์จะถูกเปิดเผยผ่าน MediaPipe Decision Task API และบล็อก AI Edge ของ Google จะจัดทำเอกสารวิธีสร้างการค้นหาบนอุปกรณ์และระบบ RAG ด้วย LiteRT ตัวชี้วัดการประเมินแบบเต็มมีอยู่ในการ์ดโมเดล

เหตุใดการฝังบนอุปกรณ์จึงมีความสำคัญ

โมเดลแบบฝังไม่ค่อยพาดหัวข่าวแบบที่โมเดลแชทชายแดนทำ แต่อยู่ใต้ฟีเจอร์ AI ที่ใช้งานได้จริงส่วนใหญ่: การค้นหาความหมาย การแนะนำ การขจัดข้อมูลซ้ำซ้อน การจัดหมวดหมู่ และการดึงข้อมูลสำหรับ RAG การเรียกใช้งานในพื้นที่จะเปลี่ยนแคลคูลัสความเป็นส่วนตัวและเวลาในการตอบสนองโดยสิ้นเชิง ข้อมูลไม่เคยออกจากอุปกรณ์ การสืบค้นทำงานแบบออฟไลน์ และไม่มีค่าใช้จ่าย API ต่อการโทร ซึ่งมีความสำคัญในระดับอุปกรณ์ฝังตัวหลายพันล้านเครื่อง

EmbeddingGemma 2 ยังเพิ่มความเข้มข้นของการแข่งขันในพื้นที่โมเดลแบบเปิดที่มีประสิทธิภาพ โดยที่ Google, Meta, Mistral และกลุ่มแล็บขนาดเล็กกำลังแข่งขันกันเพื่อพิสูจน์ว่า AI ที่มีประโยชน์สามารถทำงานได้โดยไม่ต้องใช้ศูนย์ข้อมูล รุ่นพารามิเตอร์ 740M ที่จัดการห้ารูปแบบบนโทรศัพท์ถือเป็นเครื่องหมายที่โดดเด่นในการแข่งขันครั้งนั้น หากวิถีการดาวน์โหลดของรุ่นก่อนเป็นข้อบ่งชี้ใดๆ คาดว่า EmbeddingGemma 2 จะแสดงในผลิตภัณฑ์มือถือและผลิตภัณฑ์ Edge ที่หลากหลายในอีกไม่กี่เดือนข้างหน้า

ก้าวนำหน้า AI Curve

AI บนอุปกรณ์กำลังก้าวหน้าเร็วกว่าที่คนส่วนใหญ่ตระหนัก อ่านข่าว AI ล่าสุดได้ที่ aibuzzwire.news สำหรับการรายงานข่าวการเปิดตัวโมเดลสำคัญๆ ทุกรายการ เกณฑ์มาตรฐาน และการเปิดตัวเครื่องมือสำหรับนักพัฒนา

อ่านข่าว AI เพิ่มเติม →