Pasukan Qwen Alibaba telah melancarkan Qwen3.8-Omni-Flash, model omnimodal asli generasi seterusnya yang menerima input teks, imej, audio dan video melalui satu tetingkap konteks 1 juta token. Keluaran, yang diperincikan pada blog rasmi Qwen, menandakan dorongan paling agresif pasukan itu untuk menukar audio dan video daripada input pasif menjadi medium utama yang membolehkan ejen AI melihat dan bertindak ke atas dunia.
Daripada Memahami Media kepada Bertindak Atasnya
Matlamat Qwen3.8-Omni-Flash yang dinyatakan bukan sekadar pemahaman media yang lebih baik. Menurut pasukan Qwen, model itu direka bentuk untuk memajukan sistem omnimodal daripada "memahami kandungan omnimodal" kepada "tugas merancang, alat panggilan dan menyelesaikan kerja kreatif." Dalam praktiknya, ini bermakna model itu ditujukan kepada aliran kerja seperti penyuntingan video, penciptaan video muzik, pengeluaran dan ulasan filem, ringkasan audio-visual dan perbualan suara masa nyata.
Pembingkaian agen ini memisahkan keluaran daripada model multimodal terdahulu yang menganggap audio dan video sebagai input untuk ditranskripsi atau diterangkan. Qwen berhujah bahawa audio dan video berkembang menjadi "media teras di mana ejen memahami persekitaran, sebab dan melaksanakan tugas mereka" — tuntutan yang disokong oleh syarikat dengan satu siri hasil penanda aras agen.
Nombor di Sebalik Keluaran
Merentasi 29 penilaian yang merangkumi penaakulan audio, penaakulan audio-visual dan penanda aras ejen audio-visual, Qwen berkata skor purata model meningkat lebih daripada 25% berbanding pendahulunya, Qwen3.5-Omni-Plus. Hasil tajuk utama yang dilaporkan di blog Qwen termasuk:
- Keuntungan sebanyak 36.5 mata pada WildClawBench-MM dan 22.3 mata pada AgenticVBench, dua penanda aras untuk ejen audio-visual, serta skor 69.6 pada UniClawBench.
- Peningkatan 8.3 mata pada LongAudioSpan dan keuntungan 9.6 mata pada OmniVideoBench untuk pemahaman audio dan video dalam bentuk panjang.
- Penurunan kadar ralat dramatik dalam transkripsi mesyuarat berbilang pembesar suara: AliMeeting DER dan cpWER model masing-masing jatuh daripada 88.11 dan 89.61 kepada 3.35 dan 17.18.
Dari segi persaingan, Qwen membuat perbandingan langsung dengan tawaran Google: syarikat itu mendakwa prestasi audio-visual hampir dengan Gemini 3.8 Flash dan prestasi audio keseluruhan yang melebihinya. Pengesahan bebas perbandingan tersebut akan mengambil masa, tetapi kekhususan tuntutan penanda aras menandakan bahawa Qwen menganggap model itu kompetitif di sempadan kerja omnimodal.
Tetingkap 1M-Token untuk Media Berjam-jam
Tetingkap konteks 1 juta token bersatu boleh dikatakan ciri paling praktikal keluaran itu. Oleh kerana audio dan video menggunakan token jauh lebih pantas daripada teks, kebanyakan model multimodal dalam pengeluaran mengendalikan hanya beberapa minit media pada satu masa. Tetingkap konteks tujuh angka membolehkan model menyimpan berjam-jam rakaman mesyuarat, rakaman video lanjutan atau dokumen media campuran yang besar dalam satu sesi tanpa potongan.
Qwen menyatakan bahawa model itu mengekalkan prestasi teks yang setanding dengan model teks sahaja dengan saiz yang sama — menangani pertukaran biasa di mana latihan omnimodal merendahkan keupayaan bahasa tulen.
Potongan Harga sebanyak 98% pada Input Audio
Harga adalah tempat Alibaba menggunakan tekanan paling tinggi. Menurut blog itu, harga API sejam input audio telah jatuh lebih daripada 98% berbanding dengan Qwen3.5-Omni-Plus, manakala harga sejam input audio-visual turun lebih daripada 93%. Nota metodologi syarikat mengatakan harga setiap jam dianggarkan sebagai 30 kali ganda kos input dua minit bahan sumber, dengan input audio-visual dikira pada 720p dan 1 bingkai sesaat.
Bagi pembangun yang membina ejen suara, perumus mesyuarat atau saluran paip analisis media, kos input selalunya menjadi kekangan yang mengikat pada skala. Penurunan harga dua urutan magnitud mengubah produk yang berdaya maju dari segi ekonomi — dinamik yang sama yang mendorong gelombang pertama API inferens teks yang murah.
Ketersediaan dan Ekosistem
Qwen3.8-Omni-Flash kini tersedia di Platform AI Qianwen, dengan akses API melalui Alibaba Cloud Model Studio, termasuk titik akhir masa nyata khusus untuk kes penggunaan perbualan. Pasukan itu juga telah menerbitkan alat sumber terbuka yang menyokong pada GitHub, termasuk abah-abah penilaian Qwen-Live-Harness dan Qwen-MM-Plugins, memberikan pembangun titik permulaan untuk membina ejen asli media di atas model.
Pelancaran itu mendarat secara senyap pada awal minggu tetapi mendapat daya tarikan yang ketara dalam komuniti pembangun dalam beberapa hari kebelakangan ini, menarik perbincangan besar mengenai Berita Hacker dan liputan daripada kedai teknologi yang menjejaki ekosistem model terbuka.
Maksudnya untuk Perlumbaan Omnimodal
Keluaran ini meneruskan strategi Alibaba untuk menggandingkan harga agresif dengan penanda aras kompetitif di seluruh keluarga Qwennya, yang telah berulang kali menjadi antara keturunan model terbuka yang paling banyak dimuat turun di seluruh dunia. Dengan Qwen3.8-Omni-Flash, syarikat itu bertaruh bahawa medan pertempuran seterusnya bukanlah sembang teks tetapi ejen yang boleh menonton, mendengar dan bertindak — mengedit rakaman, meringkaskan mesyuarat dan mengadakan perbualan suara masa nyata sebagai satu keupayaan bersepadu.
Untuk Google, yang Gemini 3.8 Flash adalah titik perbandingan yang jelas, mesejnya ialah sempadan omni-modal bukan lagi perlumbaan dua kuda antara makmal AS. Bagi pembangun, gabungan tetingkap multimodal token 1M dan input audio hampir bebas mengurangkan halangan kepada kelas produk ejen audio-visual yang tidak praktikal untuk disiarkan pada skala hanya beberapa bulan yang lalu.
Sama ada tuntutan penanda aras Qwen bertahan di bawah penilaian bebas akan membentuk betapa seriusnya industri melayan pertaruhan itu. Tetapi hala tuju perjalanan adalah jelas: pasukan yang membina model sempadan kini melihat telinga dan mata — bukan hanya kotak teks — sebagai antara muka lalai untuk ejen AI.
Kekal Mendahului AI
Perlumbaan omnimodal semakin pantas minggu demi minggu. Untuk berita terkini AI, analisis mendalam keluaran model baharu dan liputan alat yang membentuk industri, baca lebih banyak berita AI →.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →