Η ομάδα Qwen της Alibaba κυκλοφόρησε το Qwen3.8-Omni-Flash, ένα εγγενές παντομορφικό μοντέλο επόμενης γενιάς που δέχεται εισόδους κειμένου, εικόνας, ήχου και βίντεο μέσω ενός ενιαίου παραθύρου περιβάλλοντος 1 εκατομμυρίου διακριτικών. Η κυκλοφορία, η οποία περιγράφεται λεπτομερώς στο επίσημο ιστολόγιο της Qwen, σηματοδοτεί την πιο επιθετική ώθηση της ομάδας μέχρι στιγμής να μετατρέψει τον ήχο και το βίντεο από παθητικές εισόδους στο κύριο μέσο μέσω του οποίου οι πράκτορες AI αντιλαμβάνονται και ενεργούν στον κόσμο.
Από την κατανόηση των μέσων ενημέρωσης έως τη δράση βάσει αυτών
Ο δηλωμένος στόχος του Qwen3.8-Omni-Flash δεν είναι απλώς η καλύτερη κατανόηση των μέσων. Σύμφωνα με την ομάδα της Qwen, το μοντέλο έχει σχεδιαστεί για να προάγει τα omnimodal συστήματα από την «κατανόηση του omnimodal περιεχομένου» στον «σχεδιασμό εργασιών, την κλήση εργαλείων και την ολοκλήρωση δημιουργικής εργασίας». Στην πράξη, αυτό σημαίνει ότι το μοντέλο στοχεύει σε ροές εργασίας, όπως επεξεργασία βίντεο, δημιουργία μουσικών βίντεο, παραγωγή ταινιών και σχολιασμός, οπτικοακουστική περίληψη και φωνητικές συνομιλίες σε πραγματικό χρόνο.
Αυτό το agent Framing διαχωρίζει την κυκλοφορία από προηγούμενα πολυτροπικά μοντέλα που αντιμετώπιζαν τον ήχο και το βίντεο ως εισόδους που έπρεπε να μεταγραφούν ή να περιγραφούν. Η Qwen υποστηρίζει ότι ο ήχος και το βίντεο εξελίσσονται σε "βασικά μέσα μέσω των οποίων οι πράκτορες κατανοούν το περιβάλλον τους, τη λογική και την εκτέλεση εργασιών" — έναν ισχυρισμό που υποστηρίζει η εταιρεία με μια σειρά αποτελεσμάτων αναφοράς πρακτόρων.
Οι αριθμοί πίσω από την κυκλοφορία
Σε 29 αξιολογήσεις που καλύπτουν ηχητική συλλογιστική, οπτικοακουστική συλλογιστική και οπτικοακουστικά σημεία αναφοράς, η Qwen λέει ότι η μέση βαθμολογία του μοντέλου βελτιώνεται περισσότερο από 25% σε σχέση με τον προκάτοχό του, Qwen3.5-Omni-Plus. Τα αποτελέσματα των επικεφαλίδων που αναφέρονται στο ιστολόγιο Qwen περιλαμβάνουν:
- Κέρδος 36,5 πόντων στο WildClawBench-MM και 22,3 πόντων στο AgenticVBench, δύο σημεία αναφοράς για οπτικοακουστικούς πράκτορες, συν βαθμολογία 69,6 στο UniClawBench.
- Βελτίωση 8,3 σημείων στο LongAudioSpan και κέρδος 9,6 βαθμών στο OmniVideoBench για κατανόηση ήχου και βίντεο μεγάλης διάρκειας.
- Δραματική πτώση του ποσοστού σφάλματος στη μεταγραφή συσκέψεων πολλών ομιλητών: το AliMeeting DER και το cpWER του μοντέλου μειώθηκαν από 88,11 και 89,61 σε 3,35 και 17,18 αντίστοιχα.
Στο ανταγωνιστικό μέτωπο, η Qwen κάνει μια άμεση σύγκριση με την προσφορά της Google: η εταιρεία ισχυρίζεται ότι η οπτικοακουστική απόδοση πλησιάζει το Gemini 3.8 Flash και η συνολική απόδοση ήχου που την υπερβαίνει. Η ανεξάρτητη επαλήθευση αυτών των συγκρίσεων θα πάρει χρόνο, αλλά η ιδιαιτερότητα των αξιώσεων αναφοράς σηματοδοτεί ότι η Qwen θεωρεί το μοντέλο ανταγωνιστικό στα όρια της παντομορφικής εργασίας.
Παράθυρο 1M-Token για ώρες πολυμέσων
Το ενοποιημένο παράθυρο περιβάλλοντος 1 εκατομμυρίου διακριτικών είναι αναμφισβήτητα το πιο πρακτικό χαρακτηριστικό της κυκλοφορίας. Επειδή ο ήχος και το βίντεο καταναλώνουν διακριτικά πολύ πιο γρήγορα από το κείμενο, τα περισσότερα πολυτροπικά μοντέλα στην παραγωγή χειρίζονται μόνο λεπτά πολυμέσων τη φορά. Ένα επταψήφιο παράθυρο περιβάλλοντος επιτρέπει στο μοντέλο να κρατά ώρες εγγραφών συσκέψεων, εκτεταμένο υλικό βίντεο ή μεγάλα έγγραφα μικτών μέσων σε μία μόνο περίοδο λειτουργίας χωρίς τεμαχισμό.
Ο Qwen σημειώνει ότι το μοντέλο διατηρεί την απόδοση κειμένου συγκρίσιμη με ένα μοντέλο μόνο κειμένου του ίδιου μεγέθους — αντιμετωπίζοντας την κοινή αντιστάθμιση όπου η παντοτροπική εκπαίδευση υποβαθμίζει την καθαρή γλωσσική ικανότητα.
Μειώσεις τιμών 98% στην είσοδο ήχου
Η τιμολόγηση είναι εκεί που η Alibaba ασκεί τη μεγαλύτερη πίεση. Σύμφωνα με το ιστολόγιο, η τιμή API ανά ώρα εισόδου ήχου έχει μειωθεί περισσότερο από 98% σε σύγκριση με το Qwen3.5-Omni-Plus, ενώ η τιμή ανά ώρα εισόδου οπτικοακουστικών μέσων έχει μειωθεί περισσότερο από 93%. Το σημείωμα μεθοδολογίας της εταιρείας αναφέρει ότι οι ωριαίες τιμές υπολογίζονται ως 30 φορές το κόστος εισόδου δύο λεπτών υλικού πηγής, με οπτικοακουστική είσοδο υπολογισμένη στα 720p και 1 καρέ ανά δευτερόλεπτο.
Για προγραμματιστές που δημιουργούν φωνητικούς πράκτορες, συνοψιστές συναντήσεων ή αγωγούς ανάλυσης πολυμέσων, το κόστος εισόδου είναι συχνά ο δεσμευτικός περιορισμός στην κλίμακα. Μια πτώση τιμής δύο τάξεων μεγέθους αλλάζει ποια προϊόντα είναι οικονομικά βιώσιμα — η ίδια δυναμική που οδήγησε το πρώτο κύμα φθηνών API εξαγωγής κειμένου.
Διαθεσιμότητα και Οικοσύστημα
Το Qwen3.8-Omni-Flash είναι τώρα διαθέσιμο στην πλατφόρμα Qianwen AI, με πρόσβαση API μέσω του Alibaba Cloud Model Studio, συμπεριλαμβανομένου ενός αποκλειστικού σημείου λήξης σε πραγματικό χρόνο για περιπτώσεις χρήσης συνομιλίας. Η ομάδα έχει επίσης δημοσιεύσει υποστήριξη εργαλείων ανοιχτού κώδικα στο GitHub, συμπεριλαμβανομένης της πλεξούδας αξιολόγησης Qwen-Live-Harness και των προσθηκών Qwen-MM-Plugins, δίνοντας στους προγραμματιστές ένα σημείο εκκίνησης για τη δημιουργία εγγενών πρακτόρων μέσων πάνω από το μοντέλο.
Η εκτόξευση έγινε αθόρυβα νωρίτερα μέσα στην εβδομάδα, αλλά κέρδισε σημαντική έλξη στην κοινότητα προγραμματιστών τις τελευταίες ημέρες, προκαλώντας μια μεγάλη συζήτηση για το Hacker News και την κάλυψη από καταστήματα τεχνολογίας που παρακολουθούν το οικοσύστημα ανοιχτού μοντέλου.
Τι Σημαίνει για την Παντελή Φυλή
Η έκδοση συνεχίζει τη στρατηγική της Alibaba να συνδυάζει την επιθετική τιμολόγηση με ανταγωνιστικά σημεία αναφοράς σε όλη την οικογένεια Qwen, η οποία έχει επανειλημμένα συγκαταλεγεί μεταξύ των γραμμών ανοιχτών μοντέλων με τις περισσότερες λήψεις παγκοσμίως. Με το Qwen3.8-Omni-Flash, η εταιρεία στοιχηματίζει ότι το επόμενο πεδίο μάχης δεν είναι η συνομιλία κειμένου, αλλά οι πράκτορες που μπορούν να παρακολουθούν, να ακούν και να ενεργούν — επεξεργάζονται βίντεο, συνοψίζουν συσκέψεις και πραγματοποιούν φωνητικές συνομιλίες σε πραγματικό χρόνο ως ενιαία ενσωματωμένη δυνατότητα.
Για την Google, της οποίας το Gemini 3.8 Flash είναι το ρητό σημείο σύγκρισης, το μήνυμα είναι ότι το omni-modal frontier δεν είναι πλέον μια κούρσα δύο ίππων μεταξύ των εργαστηρίων των ΗΠΑ. Για τους προγραμματιστές, ο συνδυασμός ενός πολυτροπικού παραθύρου με διακριτικό 1M και της σχεδόν ελεύθερης εισόδου ήχου μειώνει το εμπόδιο σε μια κατηγορία προϊόντων οπτικοακουστικών πρακτόρων που δεν ήταν πρακτικό να εξυπηρετηθούν σε κλίμακα μόλις πριν από μήνες.
Το εάν οι αξιώσεις αναφοράς της Qwen διατηρηθούν υπό ανεξάρτητη αξιολόγηση θα καθορίσει πόσο σοβαρά αντιμετωπίζει ο κλάδος αυτό το στοίχημα. Αλλά η κατεύθυνση του ταξιδιού είναι σαφής: οι ομάδες που κατασκευάζουν μοντέλα συνόρων βλέπουν τώρα αυτιά και μάτια —όχι απλώς ένα πλαίσιο κειμένου— ως την προεπιλεγμένη διεπαφή για πράκτορες τεχνητής νοημοσύνης.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Η παντοτροπική φυλή επιταχύνεται εβδομάδα με την εβδομάδα. Για περισσότερες έκτακτες ειδήσεις τεχνητής νοημοσύνης, σε βάθος ανάλυση των κυκλοφοριών νέων μοντέλων και κάλυψη των εργαλείων που διαμορφώνουν τη βιομηχανία, διαβάστε περισσότερα νέα AI →.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →