Tim Qwen Alibaba wis ngluncurake Qwen3.8-Omni-Flash, model omnimodal asli generasi sabanjure sing nampa input teks, gambar, audio, lan video liwat jendela konteks 1 yuta token. Rilis kasebut, rinci ing blog Qwen resmi, nandhani dorongan paling agresif tim sing durung ngowahi audio lan video saka input pasif menyang media utama sing bisa dingerteni lan ditindakake dening agen AI ing jagad iki.

Saka Pangerten Media nganti Tumindak

Sasaran Qwen3.8-Omni-Flash sing kasebut ora mung pemahaman media sing luwih apik. Miturut tim Qwen, model kasebut dirancang kanggo maju sistem omnimodal saka "pangerten isi omnimodal" kanggo "tugas ngrancang, alat nelpon, lan ngrampungake karya kreatif." Ing praktik, tegese model kasebut ngarahake alur kerja kayata nyunting video, nggawe video musik, produksi lan komentar film, ringkesan audio-visual, lan obrolan swara wektu nyata.

Framing agen iki misahake release saka model multimodal sadurungé sing dianggep audio lan video minangka input kanggo ditranskripsi utawa diterangake. Qwen ujar manawa audio lan video berkembang dadi "media inti sing para agen ngerti lingkungane, alasan, lan nglakokake tugas" - pratelan sing didhukung perusahaan kanthi serangkaian asil benchmark agen.

Angka ing Konco Rilis

Ing antarane 29 evaluasi sing kalebu pertimbangan audio, pertimbangan audio-visual, lan pathokan agen audio-visual, Qwen ujar manawa skor rata-rata model kasebut mundhak luwih saka 25% tinimbang sadurunge, Qwen3.5-Omni-Plus. Asil judhul sing dilaporake ing blog Qwen kalebu:

  • A gain 36,5 TCTerms ing WildClawBench-MM lan 22,3 TCTerms ing AgenticVBench, loro benchmarks kanggo agen audio-visual, plus skor 69,6 ing UniClawBench.
  • Peningkatan 8.3-titik ing LongAudioSpan lan gain 9.6-titik ing OmniVideoBench kanggo pangerten audio lan video sing dawa.
  • Tingkat kesalahan dramatis ing transkripsi rapat multi-speaker: AliMeeting DER lan cpWER model mudhun saka 88.11 lan 89.61 dadi 3.35 lan 17.18.

Ing ngarep kompetitif, Qwen nggawe perbandingan langsung karo penawaran Google: perusahaan kasebut ngaku kinerja audio-visual sing cedhak karo Gemini 3.8 Flash lan kinerja audio sakabèhé sing ngluwihi. Verifikasi independen saka perbandingan kasebut bakal mbutuhake wektu, nanging kekhususan pratelan benchmark kasebut menehi tandha manawa Qwen nganggep model kasebut kompetitif ing wates karya omnimodal.

Jendela 1M-Token kanggo Jam Media

Jendhela konteks 1 yuta token sing digabungake bisa uga minangka fitur paling praktis saka rilis kasebut. Amarga audio lan video nggunakake token adoh luwih cepet tinimbang teks, paling model multimodal ing produksi mung nangani sawetara menit saka media ing wektu. Jendhela konteks pitung angka ngidini model kanggo nahan jam rekaman rapat, rekaman video lengkap, utawa dokumen media campuran gedhe ing sesi siji tanpa chunking.

Qwen nyathet yen model kasebut njaga kinerja teks sing bisa dibandhingake karo model mung teks kanthi ukuran sing padha - ngatasi masalah perdagangan umum ing ngendi latihan omnimodal ngrusak kemampuan basa murni.

Potongan Rega 98% ing Input Audio

Rega ing ngendi Alibaba ngetrapake tekanan paling akeh. Miturut blog kasebut, rega API saben jam input audio wis mudhun luwih saka 98% dibandhingake karo Qwen3.5-Omni-Plus, dene rega saben jam input audio-visual mudhun luwih saka 93%. Cathetan metodologi perusahaan ujar manawa rega saben jam dikira 30 kaping biaya input saka rong menit materi sumber, kanthi input audio-visual diitung ing 720p lan 1 pigura per detik.

Kanggo pangembang mbangun agen swara, summarizer rapat, utawa saluran pipa analisis media, biaya input asring dadi kendala ing skala. Penurunan rega rong urutan gedhene ngganti produk sing sregep ekonomi - dinamika sing padha sing nyebabake gelombang pertama API inferensi teks sing murah.

Kasedhiyan lan Ekosistem

Qwen3.8-Omni-Flash saiki kasedhiya ing Qianwen AI Platform, kanthi akses API liwat Alibaba Cloud Model Studio, kalebu titik pungkasan wektu nyata khusus kanggo kasus panggunaan obrolan. Tim kasebut uga nerbitake alat sumber terbuka sing ndhukung ing GitHub, kalebu sabuk evaluasi Qwen-Live-Harness lan Qwen-MM-Plugins, menehi pangembang titik wiwitan kanggo mbangun agen asli media ing ndhuwur model kasebut.

Peluncuran kasebut ndharat kanthi tenang ing awal minggu nanging entuk daya tarik sing signifikan ing komunitas pangembang ing jaman saiki, nggambar diskusi gedhe babagan Hacker News lan liputan saka toko teknologi sing nelusuri ekosistem model terbuka.

Apa Tegese kanggo Lomba Omnimodal

Rilis kasebut nerusake strategi Alibaba kanggo nggabungake rega agresif karo pathokan kompetitif ing kulawarga Qwen, sing wis bola-bali dadi salah sawijining turunan model terbuka sing paling diunduh ing saindenging jagad. Kanthi Qwen3.8-Omni-Flash, perusahaan taruhan yen medan perang sabanjure dudu obrolan teks nanging agen sing bisa nonton, ngrungokake, lan tumindak - nyunting cuplikan, ngringkes rapat, lan nganakake obrolan swara wektu nyata minangka kemampuan terpadu.

Kanggo Google, sing Gemini 3.8 Flash minangka titik perbandingan sing eksplisit, pesen kasebut yaiku wates omni-modal ora ana maneh balapan jaran loro ing antarane lab AS. Kanggo pangembang, kombinasi jendhela multimodal 1M-token lan input audio sing meh gratis nyuda alangan menyang kelas produk agen audio-visual sing ora praktis dilayani kanthi skala mung sawetara wulan kepungkur.

Apa pratelan pathokan Qwen tetep ana ing evaluasi independen bakal mbentuk kepiye industri nganggep taruhan kasebut. Nanging arah lelungan wis jelas: tim sing nggawe model perbatasan saiki ndeleng kuping lan mripat - ora mung kothak teks - minangka antarmuka standar kanggo agen AI.

Tetep Ahead saka AI

Lomba omnimodal nyepetake saben minggu. Kanggo warta AI sing luwih anyar, analisa jero babagan rilis model anyar, lan jangkoan alat sing mbentuk industri, waca warta AI liyane →.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →