Tim Qwen Alibaba telah meluncurkan Qwen3.8-Omni-Flash, model omnimodal asli generasi berikutnya yang menerima input teks, gambar, audio, dan video melalui satu jendela konteks 1 juta token. Peluncuran ini, yang dirinci di blog resmi Qwen, menandai upaya paling agresif yang dilakukan tim untuk mengubah audio dan video dari input pasif menjadi media utama yang digunakan agen AI untuk memahami dan bertindak terhadap dunia.

Dari Memahami Media hingga Menindakinya

Tujuan Qwen3.8-Omni-Flash bukan hanya sekedar pemahaman media yang lebih baik. Menurut tim Qwen, model ini dirancang untuk memajukan sistem omnimodal dari "memahami konten omnimodal" menjadi "merencanakan tugas, memanggil alat, dan menyelesaikan pekerjaan kreatif." Dalam praktiknya, hal ini berarti model ditujukan untuk alur kerja seperti pengeditan video, pembuatan video musik, produksi dan komentar film, ringkasan audio visual, dan percakapan suara secara real-time.

Pembingkaian agen ini memisahkan rilis dari model multimodal sebelumnya yang memperlakukan audio dan video sebagai masukan untuk ditranskripsi atau dideskripsikan. Qwen berargumentasi bahwa audio dan video berevolusi menjadi "media inti yang melaluinya para agen memahami lingkungan mereka, memberikan alasan, dan melaksanakan tugas" – sebuah klaim yang didukung oleh perusahaan tersebut dengan serangkaian hasil benchmark yang bersifat agen.

Angka-angka di Balik Rilisan

Dari 29 evaluasi yang mencakup penalaran audio, penalaran audio-visual, dan tolok ukur agen audio-visual, Qwen mengatakan skor rata-rata model ini meningkat lebih dari 25% dibandingkan pendahulunya, Qwen3.5-Omni-Plus. Hasil headline yang dilaporkan di blog Qwen antara lain:

  • Perolehan 36,5 poin di WildClawBench-MM dan 22,3 poin di AgenticVBench, dua tolok ukur untuk agen audio visual, ditambah skor 69,6 di UniClawBench.
  • Peningkatan 8,3 poin pada LongAudioSpan dan peningkatan 9,6 poin pada OmniVideoBench untuk pemahaman audio dan video jangka panjang.
  • Tingkat kesalahan menurun drastis dalam transkripsi rapat multi-pembicara: AliMeeting DER dan cpWER model turun masing-masing dari 88,11 dan 89,61 menjadi 3,35 dan 17,18.

Dalam hal persaingan, Qwen membuat perbandingan langsung dengan penawaran Google: perusahaan mengklaim kinerja audio-visual mendekati Gemini 3.8 Flash dan kinerja audio keseluruhan melebihi itu. Verifikasi independen atas perbandingan-perbandingan tersebut akan memakan waktu, namun kekhususan dari klaim tolok ukur tersebut menandakan bahwa Qwen menganggap model tersebut kompetitif di garis depan pekerjaan omnimodal.

Jendela 1 Juta Token untuk Jam Media

Jendela konteks 1 juta token terpadu bisa dibilang merupakan fitur rilis yang paling praktis. Karena audio dan video menggunakan token jauh lebih cepat daripada teks, sebagian besar model multimodal dalam produksi hanya menangani media dalam hitungan menit dalam satu waktu. Jendela konteks tujuh angka memungkinkan model menyimpan rekaman rapat, rekaman video yang diperluas, atau dokumen media campuran berukuran besar selama berjam-jam dalam satu sesi tanpa pemisahan.

Qwen mencatat bahwa model tersebut mempertahankan performa teks yang sebanding dengan model hanya teks dengan ukuran yang sama — mengatasi trade-off umum di mana pelatihan omnimodal menurunkan kemampuan bahasa murni.

Pemotongan Harga 98% untuk Input Audio

Penetapan harga adalah tempat yang paling ditekankan oleh Alibaba. Menurut blog tersebut, harga API per jam input audio telah turun lebih dari 98% dibandingkan dengan Qwen3.5-Omni-Plus, sedangkan harga input audio-visual per jam turun lebih dari 93%. Catatan metodologi perusahaan mengatakan harga per jam diperkirakan 30 kali lipat biaya input materi sumber selama dua menit, dengan input audio visual dihitung pada 720p dan 1 frame per detik.

Bagi pengembang yang membangun agen suara, ringkasan rapat, atau jalur analisis media, biaya input sering kali menjadi kendala utama dalam skala. Penurunan harga sebesar dua kali lipat mengubah produk mana yang layak secara ekonomi — dinamika yang sama yang mendorong gelombang pertama API inferensi teks murah.

Ketersediaan dan Ekosistem

Qwen3.8-Omni-Flash kini tersedia di Platform AI Qianwen, dengan akses API melalui Alibaba Cloud Model Studio, termasuk titik akhir realtime khusus untuk kasus penggunaan percakapan. Tim juga telah menerbitkan alat sumber terbuka pendukung di GitHub, termasuk alat evaluasi Qwen-Live-Harness dan Qwen-MM-Plugins, yang memberikan titik awal bagi pengembang untuk membangun agen media asli di atas model tersebut.

Peluncuran ini dilakukan secara diam-diam pada awal minggu ini namun memperoleh daya tarik yang signifikan dalam komunitas pengembang dalam beberapa hari terakhir, sehingga memicu diskusi besar di Hacker News dan liputan dari outlet teknologi yang melacak ekosistem model terbuka.

Apa Artinya bagi Perlombaan Omnimodal

Peluncuran ini melanjutkan strategi Alibaba dalam memasangkan harga yang agresif dengan tolok ukur kompetitif di seluruh keluarga Qwen, yang telah berulang kali menjadi salah satu rangkaian model terbuka yang paling banyak diunduh di seluruh dunia. Dengan Qwen3.8-Omni-Flash, perusahaan yakin bahwa medan pertempuran berikutnya bukanlah obrolan teks, melainkan agen yang dapat menonton, mendengarkan, dan bertindak — mengedit rekaman, merangkum rapat, dan mengadakan percakapan suara real-time sebagai satu kemampuan terintegrasi.

Bagi Google, yang menggunakan Gemini 3.8 Flash sebagai titik perbandingan yang jelas, pesan yang disampaikan adalah bahwa batas omni-modal tidak lagi menjadi persaingan dua pihak antara laboratorium di AS. Bagi pengembang, kombinasi jendela multimodal token 1 juta dan input audio yang hampir bebas hambatan menurunkan hambatan terhadap kelas produk agen audio-visual yang tidak praktis untuk dilayani dalam skala besar beberapa bulan yang lalu.

Apakah klaim Qwen yang menjadi acuan dapat bertahan dalam evaluasi independen akan menentukan seberapa serius industri ini memperlakukan taruhan tersebut. Namun arah perjalanannya jelas: tim yang membangun model perbatasan kini melihat telinga dan mata – bukan hanya kotak teks – sebagai antarmuka default untuk agen AI.

Tetap Terdepan dalam AI

Perlombaan omnimodal semakin cepat dari minggu ke minggu. Untuk berita AI terkini, analisis mendalam mengenai rilis model baru, dan liputan alat yang membentuk industri ini, baca berita AI selengkapnya →.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →