Google បានដឹកជញ្ជូនយ៉ាងស្ងៀមស្ងាត់នូវការអាប់ដេតគំរូ Gemini សំខាន់ៗចំនួនពីរក្នុងរយៈពេល 48 ម៉ោងក្នុងសប្តាហ៍នេះ ហើយទាំងពីរនេះគឺសំដៅទៅលើអ្នកបង្កើតកម្មវិធីបង្កើតផលិតកម្ម។ Gemini 3.5 Transcribe ដែលបានណែនាំនៅថ្ងៃទី 26 ខែសីហា គឺជាគំរូនៃការនិយាយទៅកាន់អត្ថបទដ៏ច្បាស់លាស់បំផុតរបស់ក្រុមហ៊ុនរហូតមកដល់បច្ចុប្បន្ន នេះបើយោងតាមប្លក់ផ្លូវការរបស់ Google ។ Gemini Omni 1.1 Flash ដែលបានប្រកាសកាលពីថ្ងៃទី 27 ខែសីហា នាំមកនូវការគ្រប់គ្រងកម្រិតវិជ្ជាជីវៈដល់វីដេអូទូទៅ រួមទាំងផ្នែកបន្ថែមឈុតរហូតដល់ 40 វិនាទី និងការបង្កើនកម្រិត 4K ។ ម៉ូដែលទាំងពីរអាចរកបានតាមរយៈ Gemini API នៅក្នុង Google AI Studio និង Gemini Enterprise Agent Platform។

Gemini 3.5 ប្រតិចារឹក៖ ការនិយាយទៅអត្ថបទដែលសម្អាតបន្ទាប់ពីខ្លួនវាផ្ទាល់ For more context on this story, see our ongoing AI trends.

អ្វីដែលខុសប្លែកពី Gemini 3.5 ប្រតិចារឹកពីការទទួលស្គាល់ការនិយាយធម្មតានោះ Google និយាយថា វាបំប្លែងសំឡេងឆៅដោយផ្ទាល់ទៅជាអត្ថបទដែលមានទម្រង់ជាប៉ូឡូញ ជាជាងប្រតិចារឹកឆៅ។ ម៉ូដែលនេះគ្រប់គ្រងសំឡេងរំខានផ្ទៃខាងក្រោយ ភាសាស្មុគស្មាញ និងការសម្អាតភាពមិនច្បាស់លាស់ពីដើម — វាដកពាក្យបំពេញដូចជា "ums" និង "ahs" ដោះស្រាយការកែតម្រូវដោយខ្លួនឯងដូចជា "តោះជួបគ្នាថ្ងៃអង្គារ-ទេ ថ្ងៃពុធ" និងធ្វើទ្រង់ទ្រាយលទ្ធផលដោយស្វ័យប្រវត្តិ។

លេខគោលដែល Google បានលើកឡើងគឺគួរអោយកត់សំគាល់។ ដូចដែលបានវាស់វែងដោយការវិភាគសិប្បនិម្មិត ម៉ូដែលនេះសម្រេចបាននូវអត្រាកំហុសពាក្យជាមធ្យម (WER) 4.0 ភាគរយសម្រាប់ករណីប្រើប្រាស់ស្ទ្រីម និង 2.6 ភាគរយសម្រាប់សំឡេងដែលមិនចាក់ផ្សាយ។ នៅលើតារាងពិន្ទុពហុភាសារបស់ FLEURS នៅទូទាំងភាសាកំពូល វាបង្ហោះ WER 5.50 ភាគរយនៅក្នុងរបៀបស្ទ្រីម និង 5.04 ភាគរយដែលមិនស្ទ្រីម ដោយធ្វើអោយប្រសើរឡើងលើគំរូប្រតិចារិកពីមុនរបស់ Google គឺ Chirp 3។ ពេលវេលាដើម្បីចម្លងចុងក្រោយមានភាពប្រសើរឡើង 70 ភាគរយបើប្រៀបធៀបជាមួយ Chirp 3 ម្តងទៀតដែលត្រូវបានវាស់វែងដោយការវិភាគសិប្បនិម្មិត។

គំរូដឹកជញ្ជូនជាពីរវ៉ារ្យ៉ង់សម្រាប់លំហូរការងារពីរ។ សម្រាប់កម្មវិធីបន្តផ្ទាល់ 'gemini-3.5-transcribe-live' ផ្តល់នូវការផ្សាយបន្តផ្ទាល់ពីរទិសជាមួយនឹងការពន្យាពេលទីពីរតាមរយៈ Live API កំណត់គោលដៅភ្នាក់ងារសំឡេង និងចំណងជើងពេលវេលាជាក់ស្តែង។ សម្រាប់សំឡេងដែលបានថត — ការប្រជុំ កំណត់ហេតុការហៅទូរសព្ទ បណ្ណសារ — `gemini-3.5-transcribe` ផ្តល់នូវគុណលក្ខណៈវាគ្មិនសម្រាប់វាគ្មិនរហូតដល់បីនាក់ (ជាមួយនឹងការគាំទ្រសម្រាប់ច្រើនទៀតនៅក្នុងរបៀបពិសោធន៍) និងការត្រាពេលវេលាកម្រិតពាក្យតាមរយៈ Interactions API។

សមត្ថភាពផ្សេងទៀតរួមមានការរកឃើញ និងការចម្លងដោយស្វ័យប្រវត្តិនៅទូទាំងជាង 85 ភាសាជាមួយនឹងការសង្កត់សំឡេង និងគ្រាមភាសា និងការគាំទ្រវាក្យសព្ទផ្ទាល់ខ្លួន ដូច្នេះគំរូអាចសម្របខ្លួនទៅនឹងភាសាពិសេស និងអក្ខរាវិរុទ្ធតែមួយគត់។ Google ក៏បានផ្ដល់ឱ្យនូវភ្នែកគំរូនៃប្រភេទមួយផងដែរ៖ តាមរយៈការហៅមុខងារ វាអាចផ្ទេរភារកិច្ចដូចជាការបង្កើតរូបភាព ឬការវិភាគឯកសារទៅម៉ូដែល Gemini ផ្សេងទៀត — មុខងារដែលបច្ចុប្បន្នមាននៅក្នុងកម្មវិធី Gemini នៅលើ macOS ។

Gemini Omni 1.1 Flash៖ ការបង្កើតវីដេអូរីកចម្រើនតាមពេលវេលា

ការ​បើក​ដំណើរការ​លើក​ទី​ពីរ​ដោះស្រាយ​ការ​ត្អូញត្អែរ​ជា​ទូទៅ​បំផុត​អំពី​វីដេអូ AI៖ ការគ្រប់គ្រង។ Gemini Omni 1.1 Flash គឺជាការអាប់ដេតដែលផ្តោតលើការផលិត ដែលធ្វើឱ្យវីដេអូទូទៅអាចគ្រប់គ្រងបានតាមវិធីដែលអ្នកជំនាន់មុនរបស់វាមិនមាន ដោយអ្នកគ្រប់គ្រងផលិតផល Google DeepMind Anish Nangia និង Alisa Fortin ពិពណ៌នាអំពីការចេញផ្សាយនេះថាធ្វើឱ្យ Omni 1.1 "ត្រៀមខ្លួនជាស្រេចសម្រាប់ការប្រើប្រាស់ប្រកបដោយវិជ្ជាជីវៈ"។

ផ្នែកបន្ថែមឈុតគឺជាលក្ខណៈពិសេសចំណងជើង។ ឥឡូវនេះអ្នកអភិវឌ្ឍន៍អាចបន្តបង្កើតវីដេអូដោយរលូនពីឃ្លីបដែលមានស្រាប់ ដោយគំរូវិភាគរហូតដល់ 10 វិនាទីនៃបរិបទមុន ដែលជាការលោតផ្លោះពីម៉ូដែលមុនៗដែលយោងត្រឹមតែវិនាទីចុងក្រោយប៉ុណ្ណោះ។ វីដេអូ​អាច​ត្រូវ​បាន​ពង្រីក​ក្នុង​រយៈ​ពេល 10 វិនាទី​រហូត​ដល់​ប្រវែង​សរុប 40 វិនាទី ដោយ​ធ្វើ​ឱ្យ​ប្រសើរ​ឡើង​នូវ​ភាព​ស៊ីសង្វាក់​គ្នា​នៃ​ការ​មើល​ឃើញ និង​ការ​ប្រកាន់​ខ្ជាប់​នៃ​ការ​រៀបរាប់​សម្រាប់​រឿង​ដែល​វែង​ជាង​នេះ។

ការអាប់ដេតនេះក៏បន្ថែមការបញ្ចូលស៊ុមទីមួយ និងចុងក្រោយផងដែរ ដោយអនុញ្ញាតឱ្យអ្នកអភិវឌ្ឍន៍បញ្ជាក់ស៊ុមចាប់ផ្តើម និងបញ្ចប់ដើម្បីបង្កើតចលនាកាមេរ៉ាដោយចេតនា និងរលូនរវាងការថត។ សម្រាប់ការចែកចាយ គម្រោងដែលបានបញ្ចប់អាចត្រូវបានបង្កើនដល់កម្រិតភាពច្បាស់ 4K ខណៈពេលដែលរបៀបមើលជាមុន 360p អនុញ្ញាតឱ្យអ្នកបង្កើតធ្វើការរំលឹកឡើងវិញលើការជម្រុញយ៉ាងឆាប់រហ័ស និងថោក មុនពេលធ្វើការបង្ហាញចុងក្រោយ។

ពី API ទៅផ្ទៃប្រចាំថ្ងៃ

Google ក៏កំពុងភ្ជាប់ម៉ូដែលទាំងពីរទៅក្នុងផលិតផលប្រើប្រាស់របស់ខ្លួន ដែលជាកន្លែងដែលអត្ថប្រយោជន៍នៃការចែកចាយរបស់វាបង្ហាញ។ នៅលើប្រព័ន្ធប្រតិបត្តិការ Android មុខងារ "Rambler" ថ្មីនៅក្នុង Gboard ប្រើប្រាស់ 3.5 ប្រតិចារឹក ដើម្បីប្រែក្លាយគំនិតដែលបាននិយាយទៅជាអត្ថបទដែលមានទម្រង់ល្អ ខណៈពេលដែលត្រងពាក្យបំពេញ — អ្នកប្រើប្រាស់ក៏អាចធ្វើការកែសម្រួលដោយសំឡេងផងដែរ។ ម៉ូដែលនេះក៏ផ្តល់ថាមពលតាមការកំណត់នៅក្នុងកម្មវិធី Gemini នៅលើ macOS ដំណើរការជាមួយបរិបទអេក្រង់នៅក្នុង Google Antigravity ហើយកំពុងត្រូវបានដាក់បញ្ចូលទៅក្នុង Chrome ។

សម្រាប់អ្នកអភិវឌ្ឍន៍ ការបើកដំណើរការទាំងពីរបានអានថាជាយុទ្ធសាស្រ្តមួយ៖ Google កំពុងជំរុញ Gemini ពី chatbot ដែលអ្នកនិយាយទៅកាន់ហេដ្ឋារចនាសម្ព័ន្ធដែលមើលឃើញ ឮ និងផលិតប្រព័ន្ធផ្សព្វផ្សាយ។ ជាមួយនឹង OpenAI, ElevenLabs និងក្រុមនៃការចាប់ផ្តើមវីដេអូដែលប្រកួតប្រជែងក្នុងទឹកដីតែមួយ អត្រាកំហុសពាក្យ 2.6 ភាគរយ និងឈុតឆាកដែលជាប់គ្នារយៈពេល 40 វិនាទីគឺជាការដេញថ្លៃបើករបស់ Google សម្រាប់បន្ទុកផលិតកម្មដែលពិតជាបង្កើតប្រាក់ចំណូល — ភ្នាក់ងារសំឡេង បំពង់ដាក់ចំណងជើង និងឧបករណ៍ច្នៃប្រឌិត។ អ្នកអភិវឌ្ឍន៍អាចចាប់ផ្តើមបង្កើតជាមួយម៉ូដែលទាំងពីរនៅក្នុង Google AI Studio ថ្ងៃនេះ។

ហេតុអ្វីបានជាអត្រាកំហុសពាក្យនៅតែសំខាន់

អត្រាកំហុសនៃពាក្យស្តាប់ទៅដូចជាស្ថិតិសិក្សា ប៉ុន្តែនៅក្នុងការផលិតវាគឺជាភាពខុសគ្នារវាងផលិតផលសំឡេងដែលដំណើរការ និងមួយដែលធ្វើអោយខកចិត្ត។ រាល់ការនិយាយដែលយល់ខុសនៅក្នុងភ្នាក់ងារសំឡេងធ្វើឱ្យខូចកិច្ចការមួយ៖ លេខសម្គាល់ការបញ្ជាទិញខុស ធ្វើឱ្យការរកមើលដែលបរាជ័យ អាសយដ្ឋានដែលច្របូកច្របល់ផ្ញើកញ្ចប់ទៅទីក្រុងខុស។ នោះហើយជាមូលហេតុដែលគម្លាតរវាង WER 2.6 ភាគរយលើអូឌីយ៉ូដែលមិនចាក់ផ្សាយ និងអត្រាលេខមួយខ្ទង់ខ្ពស់ដែលជារឿងធម្មតាមួយជំនាន់មុន រួមបញ្ចូលគ្នាទៅជាភាពខុសគ្នាលំដាប់នៃទំហំក្នុងការប្រើប្រាស់។

ភាពខុសគ្នារវាងរបៀបទាំងពីរដែល Google បានរាយការណ៍ក៏សំខាន់សម្រាប់ស្ថាបត្យករផងដែរ។ ការស្ទ្រីមប្រតិចារិក - តួលេខ WER 4.0 ភាគរយ - ជួញដូរភាពត្រឹមត្រូវមួយចំនួនសម្រាប់ការពន្យាពេលទីពីរ ដែលករណីប្រើប្រាស់អន្តរកម្មដូចជាភ្នាក់ងារសំឡេងផ្ទាល់ត្រូវការ។ ការចម្លងបណ្តុំនៃអូឌីយ៉ូដែលបានថតទុកដំណើរការយឺតជាង ប៉ុន្តែឈានដល់ 2.6 ភាគរយ ដែលនេះជាមូលហេតុដែលការវិភាគក្រោយការហៅទូរសព្ទ និងដំណើរការបណ្ណសារអាចមានលទ្ធភាពទាមទារកាន់តែច្រើន។ ការសម្រេចចិត្តរបស់ Google ក្នុងការលាតត្រដាងទាំងពីរជាចំណុចបញ្ចប់នៃគំរូដាច់ដោយឡែក ជាជាងការកំណត់ដែលអាចកែតម្រូវបានមួយ ទទួលស្គាល់ថាអ្នកអភិវឌ្ឍន៍បង្កើតផលិតផលផ្សេងៗគ្នានៅផ្នែកម្ខាងនៃពាណិជ្ជកម្មនោះ។

ដំណើរការការងារកម្រិតសម្រាប់ផលិតវីដេអូ

ការអាប់ដេត Omni 1.1 Flash គឺមានភាពជាក់ស្តែងដូចគ្នាអំពីរបៀបដែលការងារច្នៃប្រឌិតកើតឡើង។ វីដេអូ​ដែល​បង្កើត​ឡើង​មាន​តម្លៃ​ថ្លៃ​ក្នុង​ការ​ធ្វើ​ឡើងវិញ​ជាមួយ៖ រាល់​ការ​សាកល្បង​ភ្លាមៗ​មាន​ន័យ​ថា​ការ​បង្ហាញ​ពេញលេញ។ របៀបមើលជាមុន 360p ថ្មីបំបែកការរុករកពីការចែកចាយ ដោយអនុញ្ញាតឱ្យអ្នកបង្កើតឆ្លងកាត់ការផ្លាស់ប្តូរភ្លាមៗដោយថោក ហើយគ្រាន់តែចំណាយសម្រាប់ការបង្កើនទំហំ 4K លើការថតដែលនៅរស់រានមានជីវិតពីការពិនិត្យ។

យន្តការផ្នែកបន្ថែមនៃឈុតឆាកដោះស្រាយបញ្ហាការស៊ីសង្វាក់គ្នាដែលបានរក្សាទុកវីដេអូ AI នៅក្នុង ghetto ទំហំឈុត។ តាមរយៈការវិភាគ 10 វិនាទីនៃបរិបទពីមុនជំនួសឱ្យតែស៊ុមចុងក្រោយ គំរូអាចពង្រីកឈុតមួយក្នុងរយៈពេល 10 វិនាទីរហូតដល់ 40 វិនាទី ខណៈពេលដែលរក្សាតួអក្សរ ពន្លឺ និងរចនាប័ទ្មដែលមើលឃើញស្របគ្នា។ រួមផ្សំជាមួយនឹងការបំភាន់ស៊ុមទីមួយ និងចុងក្រោយ ដែលផ្តល់ឱ្យអ្នកកែសម្រួលកំណត់ចំណុចត្រួតពិនិត្យ ផ្លូវចូល និងចេញ សញ្ញាសម្គាល់ដំណើរការនៅក្នុងការកែសម្រួលធម្មតា - ខ្សែវីដេអូដែលបង្កើតដោយ AI ចាប់ផ្តើមសមនឹងបំពង់ក្រោយផលិតកម្មពិតប្រាកដ ជាជាងការជំនួសការលក់ដុំ។

រូបភាពប្រកួតប្រជែង

ទាំងពីរចាប់ផ្តើមដាក់ Google ជាហេដ្ឋារចនាសម្ព័ន្ធជាជាងទិសដៅ។ នៅក្នុងសុន្ទរកថា Google កំពុងទទួលយកអ្នកលក់ប្រតិចារិកឯកទេស និងបណ្តុំសំឡេងនៃគូប្រជែង cloud របស់ខ្លួន ដោយការចងក្រងភាពត្រឹមត្រូវនៃសិល្បៈទៅក្នុង Gemini API អ្នកអភិវឌ្ឍន៍ដែលខ្លួនប្រើរួចហើយ។ នៅក្នុងវីដេអូ វាកំពុងប្រកួតប្រជែងនៅក្នុងទីផ្សារដែលសម្បូរទៅដោយការចាប់ផ្តើមអាជីវកម្មដែលមានមូលនិធិល្អ ដោយសង្កត់ធ្ងន់ទៅលើការគ្រប់គ្រង និងការរួមបញ្ចូលលំហូរការងារលើទស្សនីយភាពឆៅ។

អត្ថប្រយោជន៍នៃការចែកចាយអាចជាកត្តាសម្រេចចិត្ត។ គំរូប្រតិចារិកដូចគ្នា ដែលអ្នកអភិវឌ្ឍន៍អាចហៅចេញពី Gemini API រួចហើយផ្តល់ថាមពលដល់ការសរសេរតាម Gboard's Rambler នៅលើ Android, កម្មវិធី Gemini នៅលើ macOS, Google Antigravity និង Chrome — មានន័យថា Google អាចរំលោះការអភិវឌ្ឍន៍គំរូនៅទូទាំងអន្តរកម្មអ្នកប្រើប្រាស់រាប់ពាន់លាន ខណៈពេលដែលប្រមូលសម្លេងពិភពពិតចម្រុះដែលបន្តកែលម្អវា។ សម្រាប់អ្នកអភិវឌ្ឍន៍ជ្រើសរើសបណ្តុំសុន្ទរកថា ឬវីដេអូក្នុងឆ្នាំ 2026 ឥឡូវនេះ flywheel គឺជាផ្នែកមួយនៃទីលាន។

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →