ក្រុម Qwen របស់ Alibaba បានដាក់ឱ្យដំណើរការ Qwen3.8-Omni-Flash ដែលជាគំរូ omnimodal ដើមជំនាន់ក្រោយ ដែលទទួលយកការបញ្ចូលអត្ថបទ រូបភាព អូឌីយ៉ូ និងវីដេអូ តាមរយៈបង្អួចបរិបទ 1 លាននិមិត្តសញ្ញា។ ការចេញផ្សាយដែលបានរៀបរាប់លម្អិតនៅលើប្លក់ផ្លូវការ Qwen បង្ហាញពីការជំរុញដ៏ខ្លាំងក្លាបំផុតរបស់ក្រុមដែលមិនទាន់អាចបង្វែរសំឡេង និងវីដេអូពីការបញ្ចូលអកម្មទៅជាឧបករណ៍ផ្ទុកចម្បងដែលភ្នាក់ងារ AI យល់ឃើញ និងធ្វើសកម្មភាពលើពិភពលោក។
ពីការយល់ដឹងពីប្រព័ន្ធផ្សព្វផ្សាយ រហូតដល់ការធ្វើសកម្មភាពលើវា។
គោលដៅដែលបានបញ្ជាក់របស់ Qwen3.8-Omni-Flash មិនមែនគ្រាន់តែជាការយល់ដឹងប្រព័ន្ធផ្សព្វផ្សាយកាន់តែប្រសើរនោះទេ។ យោងតាមក្រុម Qwen គំរូនេះត្រូវបានរចនាឡើងដើម្បីជំរុញប្រព័ន្ធ omnimodal ពី "ការយល់ដឹងអំពីមាតិកា omnimodal" ទៅជា "ការធ្វើផែនការកិច្ចការ ឧបករណ៍ហៅទូរស័ព្ទ និងបញ្ចប់ការងារប្រកបដោយការច្នៃប្រឌិត"។ នៅក្នុងការអនុវត្ត នោះមានន័យថា គំរូនេះគឺសំដៅលើលំហូរការងារដូចជា ការកាត់តវីដេអូ ការបង្កើតវីដេអូតន្ត្រី ការផលិតខ្សែភាពយន្ត និងការអត្ថាធិប្បាយ ការសង្ខេបជាសំឡេង និងរូបភាព និងការសន្ទនាតាមសំឡេងក្នុងពេលជាក់ស្តែង។
ស៊ុមភ្នាក់ងារនេះបំបែកការចេញផ្សាយពីគំរូពហុម៉ូឌុលមុន ដែលចាត់ទុកអូឌីយ៉ូ និងវីដេអូជាធាតុបញ្ចូលដែលត្រូវចម្លង ឬពិពណ៌នា។ Qwen ប្រកែកថា អូឌីយ៉ូ និងវីដេអូកំពុងវិវត្តទៅជា "ប្រព័ន្ធផ្សព្វផ្សាយស្នូល ដែលភ្នាក់ងារយល់ពីបរិយាកាស ហេតុផល និងការអនុវត្តការងាររបស់ពួកគេ" ដែលជាការទាមទាររបស់ក្រុមហ៊ុនគាំទ្រជាមួយនឹងលទ្ធផលស្តង់ដារភ្នាក់ងារជាបន្តបន្ទាប់។
លេខនៅពីក្រោយការចេញផ្សាយ
ឆ្លងកាត់ការវាយតម្លៃចំនួន 29 ដែលរួមមានហេតុផលអូឌីយ៉ូ ហេតុផលអូឌីយ៉ូ-រូបភាព និងស្តង់ដារភ្នាក់ងារមើលឃើញ អូឌីយ៉ូ Qwen និយាយថា ពិន្ទុមធ្យមរបស់ម៉ូដែលមានភាពប្រសើរឡើងជាង 25% ជាង Qwen3.5-Omni-Plus ជំនាន់មុនរបស់វា។ លទ្ធផលចំណងជើងដែលបានរាយការណ៍នៅលើប្លុក Qwen រួមមាន:
- ទទួលបាន 36.5 ពិន្ទុនៅលើ WildClawBench-MM និង 22.3 ពិន្ទុនៅលើ AgenticVBench ដែលជាស្តង់ដារពីរសម្រាប់ភ្នាក់ងារសោតទស្សន៍ បូកនឹងពិន្ទុ 69.6 នៅលើ UniClawBench ។
- ការកែលម្អ 8.3 ពិន្ទុនៅលើ LongAudioSpan និងការទទួលបាន 9.6 ពិន្ទុនៅលើ OmniVideoBench សម្រាប់ការយល់ដឹងអំពីអូឌីយ៉ូ និងវីដេអូដែលមានទម្រង់វែង។
- អត្រាកំហុសធ្លាក់ចុះយ៉ាងខ្លាំងនៅក្នុងការចម្លងការប្រជុំពហុវាគ្មិន៖ AliMeeting DER និង cpWER របស់ម៉ូដែលបានធ្លាក់ចុះពី 88.11 និង 89.61 ទៅ 3.35 និង 17.18 រៀងគ្នា។
នៅលើមុខការប្រកួតប្រជែង Qwen ធ្វើការប្រៀបធៀបដោយផ្ទាល់ជាមួយនឹងការផ្តល់ជូនរបស់ Google៖ ក្រុមហ៊ុនបានអះអាងនូវការសម្តែងសោតទស្សន៍នៅជិត Gemini 3.8 Flash និងការសម្តែងអូឌីយ៉ូសរុបដែលលើសពីវា។ ការផ្ទៀងផ្ទាត់ឯករាជ្យនៃការប្រៀបធៀបទាំងនោះនឹងត្រូវការពេលវេលា ប៉ុន្តែភាពជាក់លាក់នៃតារាងពិន្ទុបានអះអាងថាជាសញ្ញាដែល Qwen ចាត់ទុកគំរូប្រកួតប្រជែងនៅព្រំដែននៃការងារ omnimodal ។
បង្អួច 1M-Token សម្រាប់ម៉ោងផ្សព្វផ្សាយ
បង្អួចបរិបទនៃសញ្ញាសម្ងាត់ 1 លានដែលបង្រួបបង្រួមគឺជាមុខងារជាក់ស្តែងបំផុតនៃការចេញផ្សាយ។ ដោយសារតែអូឌីយ៉ូ និងវីដេអូប្រើប្រាស់ថូខឹនលឿនជាងអត្ថបទ ម៉ូដែលពហុមុខងារភាគច្រើននៅក្នុងផលិតកម្មគ្រប់គ្រងតែនាទីនៃមេឌៀក្នុងពេលតែមួយ។ បង្អួចបរិបទដែលមានរូបភាពប្រាំពីរអនុញ្ញាតឱ្យគំរូដើម្បីរក្សាទុកម៉ោងនៃការថតការប្រជុំ ខ្សែវីដេអូបន្ថែម ឬឯកសារប្រព័ន្ធផ្សព្វផ្សាយចម្រុះធំនៅក្នុងវគ្គតែមួយដោយមិនបាច់បំបែក។
Qwen កត់សម្គាល់ថាគំរូរក្សាដំណើរការអត្ថបទដែលប្រៀបធៀបទៅនឹងគំរូអត្ថបទដែលមានទំហំដូចគ្នា - ដោះស្រាយការដោះដូរទូទៅដែលការបណ្តុះបណ្តាល omnimodal ធ្វើឱ្យខូចសមត្ថភាពភាសាសុទ្ធ។
បញ្ចុះតម្លៃ 98% លើការបញ្ចូលសំឡេង
តម្លៃគឺជាកន្លែងដែល Alibaba កំពុងដាក់សម្ពាធខ្លាំងបំផុត។ យោងតាមប្លុក តម្លៃ API ក្នុងមួយម៉ោងនៃការបញ្ចូលអូឌីយ៉ូបានធ្លាក់ចុះជាង 98% បើធៀបនឹង Qwen3.5-Omni-Plus ខណៈដែលតម្លៃក្នុងមួយម៉ោងនៃការបញ្ចូលអូឌីយ៉ូគឺធ្លាក់ចុះជាង 93%។ កំណត់សម្គាល់វិធីសាស្រ្តរបស់ក្រុមហ៊ុននិយាយថាតម្លៃរៀងរាល់ម៉ោងត្រូវបានប៉ាន់ប្រមាណថាជា 30 ដងនៃតម្លៃបញ្ចូលនៃសម្ភារៈប្រភពពីរនាទីជាមួយនឹងការបញ្ចូលជាសំឡេងដែលគណនាក្នុងកម្រិត 720p និង 1 ស៊ុមក្នុងមួយវិនាទី។
សម្រាប់អ្នកអភិវឌ្ឍន៍ដែលបង្កើតភ្នាក់ងារសំឡេង អ្នកសង្ខេបការជួបប្រជុំ ឬបំពង់បង្ហូរការវិភាគប្រព័ន្ធផ្សព្វផ្សាយ ការចំណាយលើធាតុចូលជាញឹកញយជាឧបសគ្គដែលជាប់ទាក់ទងនឹងមាត្រដ្ឋាន។ ការធ្លាក់ចុះតម្លៃតាមលំដាប់លំដោយចំនួនពីរផ្លាស់ប្តូរដែលផលិតផលអាចដំណើរការបានខាងសេដ្ឋកិច្ច — ថាមវន្តដូចគ្នាដែលជំរុញឱ្យមានរលកដំបូងនៃ APIs អត្ថបទដែលមានតំលៃថោក។
ភាពអាចរកបាន និងប្រព័ន្ធអេកូឡូស៊ី
Qwen3.8-Omni-Flash ឥឡូវនេះមាននៅលើ Qianwen AI Platform ជាមួយនឹងការចូលប្រើ API តាមរយៈ Alibaba Cloud Model Studio រួមទាំងចំណុចបញ្ចប់ពេលវេលាជាក់ស្តែងសម្រាប់ករណីប្រើប្រាស់ការសន្ទនា។ ក្រុមការងារក៏បានបោះពុម្ពផ្សាយគាំទ្រឧបករណ៍ប្រភពបើកចំហនៅលើ GitHub រួមទាំងឧបករណ៍វាយតម្លៃ Qwen-Live-Harness និង Qwen-MM-Plugins ដែលផ្តល់ឱ្យអ្នកអភិវឌ្ឍន៍នូវចំណុចចាប់ផ្តើមសម្រាប់ការកសាងភ្នាក់ងារព័ត៌មានដើមនៅលើគំរូ។
ការដាក់ឱ្យដំណើរការបានស្ងប់ស្ងាត់កាលពីដើមសប្តាហ៍ ប៉ុន្តែទទួលបានការចាប់អារម្មណ៍យ៉ាងខ្លាំងនៅក្នុងសហគមន៍អ្នកអភិវឌ្ឍន៍ក្នុងប៉ុន្មានថ្ងៃថ្មីៗនេះ ដោយទាញការពិភាក្សាដ៏ធំមួយលើព័ត៌មាន Hacker និងការគ្របដណ្តប់ពីហាងលក់បច្ចេកវិទ្យាដែលតាមដានប្រព័ន្ធអេកូគំរូបើកចំហ។
តើវាមានន័យយ៉ាងណាសម្រាប់ការប្រណាំង Omnimodal
ការចេញផ្សាយនេះបន្តយុទ្ធសាស្រ្តរបស់ Alibaba ក្នុងការផ្គូផ្គងតម្លៃដ៏ខ្លាំងក្លាជាមួយនឹងស្តង់ដារប្រកួតប្រជែងនៅទូទាំងគ្រួសារ Qwen របស់ខ្លួន ដែលម្តងហើយម្តងទៀតក្នុងចំណោមត្រកូលម៉ូដែលបើកចំហដែលត្រូវបានទាញយកច្រើនបំផុតនៅទូទាំងពិភពលោក។ ជាមួយនឹង Qwen3.8-Omni-Flash ក្រុមហ៊ុនកំពុងភ្នាល់ថាសមរភូមិបន្ទាប់មិនមែនជាការជជែកជាអក្សរទេ ប៉ុន្តែភ្នាក់ងារដែលអាចមើល ស្តាប់ និងធ្វើសកម្មភាព — កែសម្រួលវីដេអូ សង្ខេបការប្រជុំ និងកាន់ការសន្ទនាជាសំឡេងតាមពេលវេលាជាក់ស្តែងជាសមត្ថភាពរួមបញ្ចូលគ្នាតែមួយ។
សម្រាប់ Google ដែល Gemini 3.8 Flash គឺជាចំណុចប្រៀបធៀបច្បាស់លាស់ សារគឺថា omni-modal frontier លែងជាការប្រកួតសេះពីររវាងមន្ទីរពិសោធន៍អាមេរិកទៀតហើយ។ សម្រាប់អ្នកអភិវឌ្ឍន៍ ការរួមបញ្ចូលគ្នានៃបង្អួចពហុមុខងារ 1M-token និងការបញ្ចូលសំឡេងដែលនៅជិតមិនគិតថ្លៃ កាត់បន្ថយឧបសគ្គដល់ថ្នាក់នៃផលិតផលភ្នាក់ងារមើលឃើញសំឡេង ដែលមិនមានអត្ថប្រយោជន៍ក្នុងការបម្រើក្នុងទំហំត្រឹមតែប៉ុន្មានខែមុន។
ថាតើការអះអាងគោលរបស់ Qwen ស្ថិតក្រោមការវាយតម្លៃឯករាជ្យនឹងបង្ហាញថាតើឧស្សាហកម្មនេះប្រព្រឹត្តិទៅលើការភ្នាល់នោះយ៉ាងធ្ងន់ធ្ងរប៉ុណ្ណា។ ប៉ុន្តែទិសដៅនៃការធ្វើដំណើរគឺច្បាស់ណាស់៖ ក្រុមដែលបង្កើតគំរូព្រំដែនឥឡូវនេះមើលឃើញត្រចៀក និងភ្នែក — មិនត្រឹមតែប្រអប់អត្ថបទប៉ុណ្ណោះទេ — ជាចំណុចប្រទាក់លំនាំដើមសម្រាប់ភ្នាក់ងារ AI ។
នាំមុខ AI
ការប្រណាំង omnimodal កំពុងបង្កើនល្បឿនពីមួយសប្តាហ៍ទៅមួយសប្តាហ៍។ សម្រាប់ព័ត៌មាន AI ថ្មីៗបន្ថែមទៀត ការវិភាគស៊ីជម្រៅនៃការចេញផ្សាយគំរូថ្មី និងការគ្របដណ្តប់នៃឧបករណ៍ដែលបង្កើតឧស្សាហកម្មនេះ អានព័ត៌មាន AI បន្ថែម →។
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →