Η Google απέστειλε αθόρυβα δύο σημαντικές ενημερώσεις μοντέλων Gemini μέσα σε 48 ώρες αυτήν την εβδομάδα, και οι δύο στοχεύουν ακριβώς στους προγραμματιστές που δημιουργούν εφαρμογές παραγωγής. Το Gemini 3.5 Transcribe, που παρουσιάστηκε στις 26 Αυγούστου, είναι το πιο ακριβές μοντέλο ομιλίας σε κείμενο της εταιρείας μέχρι σήμερα, σύμφωνα με το επίσημο ιστολόγιο της Google. Το Gemini Omni 1.1 Flash, που ανακοινώθηκε στις 27 Αυγούστου, φέρνει χειριστήρια επαγγελματικής ποιότητας σε παραγωγικό βίντεο, συμπεριλαμβανομένης της επέκτασης σκηνής έως 40 δευτερόλεπτα και της αναβάθμισης 4K. Και τα δύο μοντέλα είναι διαθέσιμα μέσω του Gemini API στο Google AI Studio και της πλατφόρμας Gemini Enterprise Agent.

Gemini 3.5 Μεταγραφή: ομιλία σε κείμενο που καθαρίζει τον εαυτό του For more context on this story, see our ongoing breaking AI news.

Αυτό που διακρίνει το Gemini 3.5 Transcribe από τη συμβατική αναγνώριση ομιλίας, λέει η Google, είναι ότι μετατρέπει τον ακατέργαστο ήχο απευθείας σε γυαλισμένο, μορφοποιημένο κείμενο και όχι σε ακατέργαστη μεταγραφή. Το μοντέλο χειρίζεται εγγενώς το θόρυβο φόντου, την περίπλοκη ορολογία και την εκκαθάριση δυσαρμονίας — αφαιρεί λέξεις πλήρωσης όπως "ums" και "ahs", επιλύει αυτοδιορθώσεις όπως "ας συναντήσουμε την Τρίτη—όχι, Τετάρτη" ​​και μορφοποιεί αυτόματα την έξοδο.

Οι αριθμοί αναφοράς που ανέφερε η Google είναι αξιοσημείωτοι. Όπως μετρήθηκε από την Τεχνητή Ανάλυση, το μοντέλο επιτυγχάνει μέσο ποσοστό λάθους λέξης (WER) 4,0 τοις εκατό για περιπτώσεις χρήσης ροής και 2,6 τοις εκατό για ήχο χωρίς ροή. Στο πολυγλωσσικό σημείο αναφοράς FLEURS σε κορυφαίες γλώσσες, δημοσιεύει 5,50 τοις εκατό WER σε λειτουργία ροής και 5,04 τοις εκατό μη ροή, βελτιώνοντας το προηγούμενο μοντέλο μεταγραφής της Google, το Chirp 3. Ο χρόνος μέχρι την τελική μεταγραφή βελτιώνεται κατά 70 τοις εκατό σε σύγκριση με το Chirp 3, και πάλι όπως μετρήθηκε από το Artificial Analy.

Το μοντέλο αποστέλλεται σε δύο παραλλαγές για δύο ροές εργασίας. Για ζωντανές εφαρμογές, το «gemini-3.5-transscribe-live» παρέχει συνεχή αμφίδρομη ροή με καθυστέρηση δευτερολέπτου μέσω του Live API, στοχεύοντας φωνητικούς παράγοντες και υπότιτλους σε πραγματικό χρόνο. Για εγγεγραμμένο ήχο — συσκέψεις, αρχεία καταγραφής κλήσεων, αρχεία — το «gemini-3.5-transscribe» προσφέρει απόδοση ηχείου για έως και τρία ηχεία (με υποστήριξη για περισσότερα σε πειραματική λειτουργία) και χρονικές σημάνσεις σε επίπεδο λέξης μέσω του API Interactions.

Άλλες δυνατότητες περιλαμβάνουν αυτόματη ανίχνευση και μεταγραφή σε περισσότερες από 85 γλώσσες με χειρισμό προφοράς και διαλέκτου και προσαρμοσμένη υποστήριξη λεξιλογίου, ώστε το μοντέλο να προσαρμόζεται σε εξειδικευμένη ορολογία και μοναδικές ορθογραφίες. Η Google έδωσε επίσης ένα είδος στα μάτια του μοντέλου: μέσω της κλήσης συναρτήσεων, μπορεί να αναθέτει εργασίες όπως η δημιουργία εικόνων ή η ανάλυση αρχείων σε άλλα μοντέλα Gemini — μια λειτουργία που είναι διαθέσιμη επί του παρόντος στην εφαρμογή Gemini στο macOS.

Gemini Omni 1.1 Flash: η δημιουργία βίντεο μεγαλώνει ένα χρονοδιάγραμμα

Η δεύτερη εκκίνηση αντιμετωπίζει το πιο συνηθισμένο παράπονο σχετικά με το βίντεο AI: τον έλεγχο. Το Gemini Omni 1.1 Flash είναι μια ενημέρωση που εστιάζει στην παραγωγή που καθιστά το παραγωγικό βίντεο κατευθυνόμενο με τρόπους που δεν ήταν οι προκάτοχοί του, με τους διαχειριστές προϊόντων του Google DeepMind, Anish Nangia και Alisa Fortin να περιγράφουν την κυκλοφορία ότι καθιστά το Omni 1.1 "έτοιμο για επαγγελματική χρήση".

Η επέκταση σκηνής είναι η λειτουργία επικεφαλίδας. Οι προγραμματιστές μπορούν τώρα να συνεχίσουν να δημιουργούν πλάνα απρόσκοπτα από ένα υπάρχον κλιπ, με το μοντέλο να αναλύει έως και 10 δευτερόλεπτα προηγούμενου περιβάλλοντος — ένα άλμα από τα προηγούμενα μοντέλα που αναφέρονταν μόνο στο τελευταίο δευτερόλεπτο. Τα βίντεο μπορούν να επεκταθούν σε βήματα των 10 δευτερολέπτων έως και αθροιστική διάρκεια 40 δευτερολέπτων, βελτιώνοντας την οπτική συνέπεια και την αφήγηση για μεγαλύτερες ιστορίες.

Η ενημέρωση προσθέτει επίσης παρεμβολή πρώτου και τελευταίου καρέ, επιτρέποντας στους προγραμματιστές να καθορίσουν τα καρέ έναρξης και τέλους για να δημιουργήσουν ομαλές, σκόπιμες κινήσεις της κάμερας και μεταβάσεις μεταξύ των λήψεων. Για παράδοση, τα ολοκληρωμένα έργα μπορούν να αναβαθμιστούν σε ανάλυση 4K, ενώ η λειτουργία προεπισκόπησης 360p επιτρέπει στους δημιουργούς να επαναλαμβάνουν τις προτροπές γρήγορα και οικονομικά πριν δεσμευτούν για τελικές αποδόσεις.

Από το API στις καθημερινές επιφάνειες

Η Google ενσωματώνει επίσης και τα δύο μοντέλα στα καταναλωτικά της προϊόντα, όπου φαίνεται το πλεονέκτημα διανομής της. Στο Android, η νέα λειτουργία "Rambler" στο Gboard χρησιμοποιεί τη μεταγραφή 3.5 για να μετατρέψει τις προφορικές σκέψεις σε καλά μορφοποιημένο κείμενο, ενώ φιλτράρει τις λέξεις συμπλήρωσης — οι χρήστες μπορούν ακόμη και να κάνουν αλλαγές με φωνή. Το μοντέλο παρέχει επίσης υπαγόρευση στην εφαρμογή Gemini στο macOS, λειτουργεί παράλληλα με το περιβάλλον οθόνης στο Google Antigravity και ενσωματώνεται στο Chrome.

Για τους προγραμματιστές, οι δύο εκκινήσεις διαβάζονται ως μία στρατηγική: η Google ωθεί το Gemini από ένα chatbot με το οποίο μιλάτε σε υποδομή που βλέπει, ακούει και παράγει πολυμέσα. Με το OpenAI, το ElevenLabs και μια ομάδα startups βίντεο να ανταγωνίζονται στην ίδια περιοχή, το ποσοστό λάθους λέξεων 2,6 τοις εκατό και οι συνεκτικές σκηνές 40 δευτερολέπτων είναι η αρχική προσφορά της Google για τους φόρτους εργασίας παραγωγής που δημιουργούν πραγματικά έσοδα - φωνητικούς παράγοντες, υπότιτλους και δημιουργικά εργαλεία. Οι προγραμματιστές μπορούν να ξεκινήσουν τη δημιουργία και με τα δύο μοντέλα στο Google AI Studio σήμερα.

Γιατί το ποσοστό σφαλμάτων λέξης εξακολουθεί να έχει σημασία

Το ποσοστό σφαλμάτων λέξεων μοιάζει με ακαδημαϊκό στατιστικό στοιχείο, αλλά στην παραγωγή είναι η διαφορά μεταξύ ενός προϊόντος φωνής που λειτουργεί και ενός προϊόντος που απογοητεύει. Κάθε παρεξηγημένη έκφραση σε έναν φωνητικό πράκτορα σπάει μια εργασία: ένα αναγνωριστικό παραγγελίας που δεν ακούγεται σωστά ενεργοποιεί μια αποτυχημένη αναζήτηση, μια μπερδεμένη διεύθυνση στέλνει ένα πακέτο σε λάθος πόλη. Αυτός είναι ο λόγος για τον οποίο το χάσμα μεταξύ ενός WER 2,6 τοις εκατό σε ήχο χωρίς ροή και των υψηλών μονοψήφιων ρυθμών που ήταν συνηθισμένοι μια γενιά μοντέλων πριν συνδυάζεται σε μια διαφορά τάξης μεγέθους στη χρηστικότητα.

Η διάκριση μεταξύ των δύο τρόπων λειτουργίας που ανέφερε η Google έχει επίσης σημασία για τους αρχιτέκτονες. Η μεταγραφή ροής - ο αριθμός WER 4,0 τοις εκατό - ανταλλάσσει κάποια ακρίβεια με δευτερεύοντα λανθάνοντα χρόνο, κάτι που απαιτούν περιπτώσεις διαδραστικής χρήσης όπως οι ζωντανοί πράκτορες φωνής. Η μαζική μεταγραφή του εγγεγραμμένου ήχου εκτελείται πιο αργά, αλλά φτάνει το 2,6 τοις εκατό, γι' αυτό τα αναλυτικά στοιχεία μετά την κλήση και η επεξεργασία αρχειοθέτησης μπορούν να είναι πιο απαιτητικά. Η απόφαση της Google να εκθέσει και τα δύο ως ξεχωριστά τελικά σημεία μοντέλων και όχι ως μια ρυθμιζόμενη ρύθμιση, αναγνωρίζει ότι οι προγραμματιστές δημιουργούν διαφορετικά προϊόντα και στις δύο πλευρές αυτού του ανταγωνισμού.

Μια κλιμακωτή ροή εργασιών για την παραγωγή βίντεο

Η ενημέρωση του Omni 1.1 Flash είναι εξίσου ρεαλιστική σχετικά με τον τρόπο με τον οποίο συμβαίνει στην πραγματικότητα η δημιουργική εργασία. Η επανάληψη του βίντεο δημιουργίας ήταν ακριβή: κάθε πείραμα προτροπής σήμαινε πλήρη απόδοση. Η νέα λειτουργία προεπισκόπησης 360p διαχωρίζει την εξερεύνηση από την παράδοση, επιτρέποντας στους δημιουργούς να εναλλάσσονται με τις άμεσες παραλλαγές φθηνά και να πληρώνουν μόνο για την αναβάθμιση 4K στις λήψεις που επιβιώνουν από τον έλεγχο.

Οι μηχανικοί επέκτασης σκηνής αντιμετωπίζουν το πρόβλημα συνοχής που έχει κρατήσει το βίντεο AI στο γκέτο μεγέθους κλιπ. Αναλύοντας 10 δευτερόλεπτα προηγούμενου πλαισίου αντί μόνο του τελικού καρέ, το μοντέλο μπορεί να επεκτείνει μια σκηνή σε βήματα των 10 δευτερολέπτων έως και 40 δευτερόλεπτα, διατηρώντας ταυτόχρονα τους χαρακτήρες, τον φωτισμό και το οπτικό στυλ. Σε συνδυασμό με την παρεμβολή πρώτου και τελευταίου καρέ — η οποία δίνει στους συντάκτες ντετερμινιστικά σημεία ελέγχου, τη λειτουργία των δεικτών εισόδου και εξόδου στη συμβατική επεξεργασία — το υλικό που δημιουργείται από την τεχνητή νοημοσύνη αρχίζει να ταιριάζει σε πραγματικούς αγωγούς μετά την παραγωγή αντί να τα αντικαθιστά χονδρικά.

Η αγωνιστική εικόνα

Και οι δύο εκδόσεις τοποθετούν την Google ως υποδομή και όχι ως προορισμό. Στην ομιλία, η Google αναλαμβάνει εξειδικευμένους προμηθευτές μεταγραφής και τις φωνητικές στοίβες των ανταγωνιστών της στο cloud, ομαδοποιώντας την ακρίβεια αιχμής στο Gemini API που χρησιμοποιούν ήδη οι προγραμματιστές της. Στο βίντεο, ανταγωνίζεται σε μια αγορά γεμάτη με καλά χρηματοδοτούμενες νεοφυείς επιχειρήσεις, δίνοντας έμφαση στον έλεγχο και την ενσωμάτωση της ροής εργασίας έναντι του ακατέργαστου θεάματος.

Το πλεονέκτημα διανομής μπορεί να είναι ο αποφασιστικός παράγοντας. Το ίδιο μοντέλο μεταγραφής που μπορούν να καλέσουν οι προγραμματιστές από το Gemini API τροφοδοτεί ήδη την υπαγόρευση Rambler του Gboard στο Android, την εφαρμογή Gemini στο macOS, το Google Antigravity και το Chrome — που σημαίνει ότι η Google μπορεί να αποσβέσει την ανάπτυξη μοντέλων σε δισεκατομμύρια αλληλεπιδράσεις χρηστών ενώ συλλέγει τον ποικίλο ήχο του πραγματικού κόσμου που συνεχίζει να τον βελτιώνει. Για προγραμματιστές που επιλέγουν μια στοίβα ομιλίας ή βίντεο το 2026, αυτός ο σφόνδυλος είναι πλέον μέρος του αγωνιστικού χώρου.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →