Google បានដាក់ឱ្យដំណើរការ EmbeddingGemma 2 ដែលជាគំរូបង្កប់ដោយបើកចំហ និងស្រាល ដែលគូសផែនទីរួមបញ្ចូលគ្នានៃអត្ថបទ រូបភាព អូឌីយ៉ូ និងវីដេអូទៅក្នុងកន្លែងបង្កប់តែមួយ។ សេចក្តីប្រកាសដែលបានបង្ហោះនៅថ្ងៃទី 6 ខែតុលា ឆ្នាំ 2026 ដោយវិស្វករស្រាវជ្រាវ Google DeepMind Sahil Dua និង Henrique Schechter Vera បានដាក់គំរូប៉ារ៉ាម៉ែត្រ 740 លានជាជម្រើសដែលមានសមត្ថភាពបំផុតសម្រាប់ការបង្កប់ពហុម៉ូឌុលនៅលើឧបករណ៍ ដែលចេញផ្សាយក្រោមអាជ្ញាប័ណ្ណ Apache 2.0 ដែលមានការអនុញ្ញាតជាពាណិជ្ជកម្ម និងបង្កើតឡើងនៅលើស្ថាបត្យកម្ម Gemma 4 ។

EmbeddingGemma ដំបូងបានលើសពីការរំពឹងទុករបស់ Google ដោយមានការទាញយកច្រើនជាង 20 លានដែលដំណើរការឧបករណ៍ស្វែងរកនៅលើឧបករណ៍ និង privacy-first retrieval pipelines augmented generation។ វគ្គបន្តបានបង្កើតចំណាប់អារម្មណ៍អ្នកអភិវឌ្ឍន៍ភ្លាមៗ ដោយទាញការពិភាក្សាដ៏ធំបំផុតមួយក្នុងចំនោមការពិភាក្សារបស់ Hacker News ដ៏ធំបំផុតនាពេលបច្ចុប្បន្ននេះ នៅពេលដែលអ្នកសាងសង់បានវាយតម្លៃពីអត្ថន័យនៃកម្មវិធីបង្កប់ពហុម៉ូឌុលតែមួយសម្រាប់កម្មវិធីក្នុងស្រុក AI news បណ្ណាល័យប្រព័ន្ធផ្សព្វផ្សាយ និងប្រព័ន្ធ RAG ដែលមិនដែលប៉ះលើពពក។

គំរូមួយសម្រាប់អត្ថបទ កូដ រូបភាព អូឌីយ៉ូ និងវីដេអូ

សមត្ថភាពចំណងជើងរបស់ EmbeddingGemma 2 គឺជាពហុមុខងារដើម។ ជាជាងដំណើរការកម្មវិធីបំប្លែងកូដដោយឡែកពីគ្នាតាមម៉ូឌុល និងលទ្ធផលភ្ជាប់ជាមួយគ្នា គំរូបង្កប់បន្សំនៃអត្ថបទ កូដ រូបភាព វីដេអូ និងអូឌីយ៉ូទៅក្នុងចន្លោះតែមួយ។ ឧទាហរណ៍របស់ Google រួមមានការស្វែងរកវីដេអូឃ្លីបជាក់លាក់មួយដោយប្រើអនុសរណៈសំឡេងជាសំណួរ ឬការស្វែងរកម៉ោងនៃការថតសំឡេងដោយប្រើសារអត្ថបទ ដែលដំណើរការទាំងអស់ដោយម៉ូដែលតែមួយនៅលើផ្នែករឹងក្នុងស្រុក។

ស្ថាបត្យកម្មគឺម៉ូឌុល។ ស្នូលសម្រាប់តែអត្ថបទទាមទារនូវប៉ារ៉ាម៉ែត្រតិចតួចដល់ទៅ 270 លានជាមួយនឹងចក្ខុវិស័យស្រេចចិត្ត (170 លានប៉ារ៉ាម៉ែត្រ) និងអូឌីយ៉ូ (300 លានប៉ារ៉ាម៉ែត្រ) ឧបករណ៍បំលែងកូដបន្ថែមការគាំទ្រពហុម៉ូឌុលពេញលេញ។ ដូច្នេះ អ្នកអភិវឌ្ឍន៍អាចដាក់ពង្រាយកម្មវិធីបង្កប់អត្ថបទតូចថ្ងៃនេះ ហើយរីកចម្រើនទៅជាការទាញយកពហុម៉ូឌុលពេញលេញដោយមិនផ្លាស់ប្តូរគ្រួសារគំរូ។

លទ្ធផលស្តង់ដារ និងប្រសិទ្ធភាពនៃការផ្ទុក

Google រាយការណ៍ថា EmbeddingGemma 2 សម្រេចបានពិន្ទុនាំមុខក្នុងចំណោម sub-1B multimodal embedders នៅលើ benchmarks រួមទាំង MTEB (Massive Text Embedding Benchmark) Code និង MAEB (Massive Audio Embedding Benchmark) ខណៈពេលដែលការផ្គូផ្គង ឬដំណើរការជាងម៉ូដែលធំ ៗ ជាច្រើននៅទូទាំងអត្ថបទ ចក្ខុវិស័យ និងកិច្ចការអូឌីយ៉ូ។ ការទទួលបានជាក់ស្តែងបំផុតគឺនៅក្នុងកូដ៖ ការអនុវត្តកូដ MTEB បានកើនឡើង 9.92 ពិន្ទុ ពី 68.76 ដល់ 78.68 ដែល Google និយាយថាធ្វើឱ្យគំរូនេះសមល្អទៅនឹងការបង្កើតលិបិក្រមមូលដ្ឋានកូដក្នុងស្រុក ការស្វែងរកកូដ semantic និងការទាញយកភ្នាក់ងារសរសេរកូដ។ តាមរយៈរូបភាព វីដេអូ ឯកសារ និងអូឌីយ៉ូ ក្រុមហ៊ុនទាមទារស្តង់ដារថ្មីក្នុងគុណភាពក្នុងមួយប៉ារ៉ាម៉ែត្រសម្រាប់ម៉ូដែលរង 1B ដោយនិយាយថាវាថែមទាំងដំណើរការជាងម៉ូដែលឯកទេសមួយចំនួនច្រើនជាងទំហំរបស់វាពីរដង។

ប្រសិទ្ធភាពនៃការផ្ទុកបានមកពី Matryoshka Representation Learning (MRL)។ វ៉ិចទ័រលទ្ធផលអាចត្រូវបានកាត់ជាថាមវន្តពីវិមាត្រ 768 ចុះមកត្រឹមទំហំ 512, 256 ឬ 128 ដោយផ្តល់នូវការកាត់បន្ថយទំហំផ្ទុករហូតដល់ 6x សម្រាប់មូលដ្ឋានទិន្នន័យវ៉ិចទ័រក្នុងស្រុក និងការប្រើប្រាស់អង្គចងចាំ។ សម្រាប់អ្នកអភិវឌ្ឍន៍ដែលកំពុងដំណើរការការទាញយកនៅលើទូរសព្ទ ឬផ្នែករឹងដែលបានបង្កប់ ភាពខុសគ្នានោះច្រើនតែកំណត់ថាតើមុខងារមួយអាចបញ្ជូនបានឬអត់។

រចនាឡើងសម្រាប់ថវិកាផ្នែករឹង

ស្នាមជើងនៅលើឧបករណ៍គឺជាចំណុចលក់ស្នូលរបស់ម៉ូដែល។ ជាមួយនឹងបរិមាណ Google រាយការណ៍ថា EmbeddingGemma 2 ត្រូវការ RAM សកម្មប្រហែល 191MB សម្រាប់ទម្ងន់សម្រាប់តែអត្ថបទ និងប្រហែល 567MB សម្រាប់ម៉ូដែលពហុមុខងារពេញលេញនៅលើ Google Pixel 11 Pro ។ បង្អួចបរិបទក៏បានកើនឡើងដល់ 8,000 ថូខឹន ដែលមានទំហំធំជាង EmbeddingGemma 1 បួនដង គ្រប់គ្រាន់ដើម្បីដំណើរការរហូតដល់ 5.5 នាទីនៃអូឌីយ៉ូ 29 រូបភាព ឬ 58 ស៊ុមវីដេអូក្នុងសំបុត្រតែមួយ ឬបន្សំអន្តរកម្មរបស់វា។

ដោយសារតែម៉ូដែលនេះចែករំលែកឧបករណ៍បំប្លែងអក្សរ និងឧបករណ៍បំប្លែងសំឡេងរបស់វាជាមួយ Gemma 4 អ្នកអភិវឌ្ឍន៍អាចដំណើរការ EmbeddingGemma 2 រួមជាមួយ Gemma 4 នៅក្នុងបំពង់បង្រួបបង្រួមជាមួយនឹងមេម៉ូរីរួមបញ្ចូលគ្នាទាប ដែលបើកដំណើរការ RAG នៅលើឧបករណ៍ ដែលការទាញយក និងជំនាន់កើតឡើងនៅក្នុងមូលដ្ឋាន។ Google បង្ហាញវានៅក្នុងកម្មវិធី AI Edge Foresight របស់ខ្លួន ដោយផ្គូផ្គងការទាញយកឯកសារក្នុងស្រុកជាមួយនឹងហេតុផលបរិបទ Gemma 4 ។

ឧបករណ៍ និងភាពអាចរកបាន

ម៉ូដែលនេះអាចរកបានតាមរយៈឧបករណ៍ AI Edge របស់ Google ។ កម្មវិធី Google AI Edge Gallery បង្ហាញពី Instant Media Search ដែលស្វែងរកការផ្គូផ្គងបណ្ណាល័យដោយភាពស្រដៀងគ្នានៃអត្ថន័យពីសំណួរអត្ថបទ ឬរូបភាព និង Video Moments Finder ដែលកំណត់ទីតាំងឈុតឆាកជាក់លាក់ដោយប្រើសំណួរអត្ថបទ ឬសំឡេង។ ការចាត់ថ្នាក់ ការកំណត់ផ្លូវ និងករណីប្រើប្រាស់តាមពេលវេលាជាក់ស្តែងត្រូវបានបង្ហាញតាមរយៈ MediaPipe Decision Task API និងឯកសារប្លក់ AI Edge របស់ Google អំពីរបៀបបង្កើតការស្វែងរកនៅលើឧបករណ៍ និងប្រព័ន្ធ RAG ជាមួយ LiteRT។ មាត្រដ្ឋានវាយតម្លៃពេញលេញមាននៅក្នុងកាតគំរូ។

ហេតុអ្វីបានជាការបង្កប់នៅលើឧបករណ៍មានបញ្ហា

ម៉ូដែលបង្កប់កម្របង្កើតចំណងជើងដូចដែលម៉ូដែលជជែកតាមព្រំដែនធ្វើ ប៉ុន្តែពួកវាស្ថិតនៅក្រោមមុខងារ AI ជាក់ស្តែងបំផុត៖ ការស្វែងរកតាមន័យធៀប ការណែនាំ ការដកស្ទួន ចំណាត់ថ្នាក់ និងការទាញយកមកវិញសម្រាប់ RAG ។ ការដំណើរការពួកវាក្នុងមូលដ្ឋានផ្លាស់ប្តូរការគណនាឯកជនភាព និងពេលយឺតយ៉ាវទាំងស្រុង។ ទិន្នន័យមិនដែលចាកចេញពីឧបករណ៍នោះទេ សំណួរដំណើរការដោយគ្មានអ៊ីនធឺណិត ហើយមិនមានការចំណាយ API តាមការហៅទូរសព្ទទេ ដែលសំខាន់ចំពោះទំហំឧបករណ៍បង្កប់រាប់ពាន់លាន។

EmbeddingGemma 2 ក៏បង្កើនការប្រកួតប្រជែងនៅក្នុងចន្លោះគំរូបើកចំហប្រកបដោយប្រសិទ្ធភាព ដែល Google, Meta, Mistral និងក្រុមនៃមន្ទីរពិសោធន៍តូចៗកំពុងប្រកួតប្រជែងដើម្បីបញ្ជាក់ថា AI មានប្រយោជន៍អាចដំណើរការដោយគ្មានមជ្ឈមណ្ឌលទិន្នន័យ។ ម៉ូដែល 740M-parameter ដែលគ្រប់គ្រងទម្រង់ប្រាំនៅលើទូរស័ព្ទគឺជាសញ្ញាសម្គាល់ដ៏គួរឱ្យកត់សម្គាល់នៅក្នុងការប្រណាំងនោះ។ ប្រសិនបើគន្លងនៃការទាញយករបស់អ្នកកាន់តំណែងមុនរបស់វាគឺជាការបង្ហាញណាមួយ រំពឹងថា EmbeddingGemma 2 នឹងបង្ហាញនៅក្នុងជួរដ៏ធំទូលាយនៃផលិតផលទូរស័ព្ទ និងគែមក្នុងរយៈពេលប៉ុន្មានខែខាងមុខនេះ។

បន្តឆ្ពោះទៅមុខ AI Curve

AI នៅលើឧបករណ៍កំពុងដំណើរការលឿនជាងមនុស្សភាគច្រើនដឹង។ អានព័ត៌មាន AI ចុងក្រោយបំផុតនៅលើ aibuzzwire.news សម្រាប់ការគ្របដណ្តប់នៃរាល់ការបើកដំណើរការម៉ូដែលសំខាន់ៗ ស្តង់ដារ និងការបញ្ចេញឧបករណ៍អ្នកអភិវឌ្ឍន៍។

អានព័ត៌មាន AI បន្ថែម →