Η Google κυκλοφόρησε την Τρίτη το Gemini 3.8 Flash, το νεότερο μοντέλο της που τοποθετείται ως το καλύτερο σύστημα λογικής και κωδικοποίησης της εταιρείας, αλλά στην ίδια τιμή με τον προκάτοχό της, μαζί με μια εξειδικευμένη παραλλαγή που ονομάζεται Gemini 3.8 Flash Cyber που έχει σχεδιαστεί για αμυντική εργασία στον κυβερνοχώρο. Η ανακοίνωση, που δημοσιεύτηκε στο επίσημο blog της Google από τον Tulsee Doshi, ανώτερο διευθυντή διαχείρισης προϊόντων, και τη Raluca Ada Popa, επικεφαλής ασφαλείας Gemini στο Google DeepMind, σηματοδοτεί την τρίτη κυκλοφορία Flash της Google σε μόλις έξι εβδομάδες.
Το λανσάρισμα προσγειώνεται στη μέση μιας ασυνήθιστα γεμάτη σεζόν κυκλοφορίας και είναι μια άμεση απάντηση στην πίεση που ασκούν οι ανταγωνιστές όσον αφορά τις τιμές και τις επιδόσεις στη σειρά μοντέλων της Google. Για μια ευρύτερη εικόνα του τρόπου με τον οποίο τα συνοριακά εργαστήρια ανταλλάσσουν χτυπήματα, η ομάδα έκτακτες ειδήσεις τεχνητής νοημοσύνης παρακολουθεί κάθε σημαντική έκδοση μοντέλου καθώς συμβαίνει.
Δύο παραλλαγές, ένα θεμέλιο
Το Gemini 3.8 έρχεται σε δύο εκδόσεις που βασίζονται στην ίδια θεμελιώδη νοημοσύνη. Το Gemini 3.8 Flash είναι το εργαλείο γενικής χρήσης: η Google λέει ότι προσφέρει σημαντικές βελτιώσεις σε σχέση με το 3.7 Flash σε μηχανική λογισμικού, πρακτορεία και συλλογισμό πολλαπλών βημάτων σε εξειδικευμένους τομείς, στην ίδια τιμή γνωριμίας 0,75 $ ανά εκατομμύριο διακριτικά εισόδου και 3,75 $ ανά εκατομμύριο μάρκες εξόδου.
Το Gemini 3.8 Flash Cyber περιγράφεται ως το πιο ικανό μοντέλο κυβερνοασφάλειας της Google, με αυτό που η εταιρεία αποκαλεί επιδόσεις σε επίπεδο συνόρων στον εντοπισμό ευπάθειας και την αυτοματοποιημένη ενημέρωση κώδικα. Σε αντίθεση με το τυπικό μοντέλο Flash, δεν είναι ευρέως διαθέσιμο — η Google το διανέμει σε ένα σύνολο αξιόπιστων υπερασπιστών μέσω ενός νέου προγράμματος που ονομάζεται Fairwind.
Σύμφωνα με την ανάρτηση ιστολογίου, τα κέρδη κωδικοποίησης και συλλογισμού στον κοινό πυρήνα προήλθαν εν μέρει από την αυστηρή εκπαίδευση στον απαιτητικό τομέα της κυβερνοασφάλειας και και τα δύο μοντέλα επιταχύνθηκαν από μακροχρόνιους πράκτορες βρόχους που σχεδιάστηκαν για την αναδρομική αξιολόγηση και βελτίωση των υποκείμενων μοντέλων.
Σημεία αναφοράς: Δουλεύοντας σκληρότερα, όχι απλώς μεγαλώνοντας
Οι ισχυρισμοί αναφοράς της Google επικεντρώνονται σε μια σχεδιαστική φιλοσοφία που η εταιρεία συνοψίζει ξεκάθαρα: 3.8 Flash "δουλεύει σκληρότερα". Σε περίπλοκες εργασίες, το μοντέλο εκτελεί επιπλέον βήματα συλλογιστικής και καλεί εργαλεία επαναληπτικά, μερικές φορές καταναλώνοντας περισσότερα διακριτικά για να μεγιστοποιήσει την απόδοση σε υψηλότερα επίπεδα προσπάθειας. Οι προγραμματιστές μπορούν να μειώσουν την προσπάθεια για να μειώσουν την επιβάρυνση του κουπονιού ή να παραμείνουν στο Gemini 3.7 Flash, το οποίο παραμένει πλήρως υποστηριζόμενο για φόρτους εργασίας που προέρχονται από την αποδοτικότητα.
Τα αποτελέσματα των επικεφαλίδων που αναφέρει η Google:
- DeepSWE v1.1 (μηχανική λογισμικού μακρού ορίζοντα): 3.8 Το Flash ξεπερνά τα περισσότερα μοντέλα συνόρων στην αυτόνομη επίλυση σύνθετων προβλημάτων μηχανικής από άκρο σε άκρο, σε αυτό που η Google περιγράφει ως κλάσμα του κόστους.
- Vals Finance Agent V2 and Harvey's Legal Agent Benchmark: 3.8 Flash υπερτερεί του 3.7 Flash και άλλων προηγμένων μοντέλων σε ποσοτικούς και επαγγελματικούς τομείς που απαιτούν προηγμένη ανάλυση και αναφορά.
- HLE-Verified: 3.8 Flash επιτυγχάνει 54,9%, το οποίο η Google παρουσιάζει ως απόδειξη συλλογισμού πολλαπλών βημάτων σε τομείς STEM, ανθρωπιστικών επιστημών και επαγγελματικών επιστημών.
Flash Cyber: Άμυνα έναντι επίθεσης
Η παραλλαγή Cyber είναι η πιο ασυνήθιστη έκδοση. Η Google λέει ότι σκόπιμα έδωσε προτεραιότητα στη διόρθωση ευπάθειας έναντι των επιθετικών δυνατοτήτων όπως η εκμετάλλευση. Στο CWE-Bench, ένα εξωτερικό σημείο αναφοράς ενημέρωσης κώδικα που διαχειρίζεται η Collinear, το Gemini 3.8 Flash Cyber σημείωσε pass@1 47,2% — ακριβώς πίσω από ένα κορυφαίο μοντέλο με 47,8%, σύμφωνα με την Google, αλλά με σημαντικά χαμηλότερο κόστος, τοποθετώντας το στα όρια Pareto του σημείου αναφοράς.
Στο CyberGym, ένα τυπικό σημείο αναφοράς της βιομηχανίας για την εύρεση τρωτών σημείων, η Google λέει ότι το μοντέλο Cyber παρουσιάζει αυτόνομη ανακάλυψη ευπάθειας σε επίπεδο συνόρων, ξεπερνώντας τον προκάτοχό του 3.5 Flash Cyber καθώς και σημαντικά μεγαλύτερα μοντέλα συνόρων. Στο εσωτερικό σημείο αναφοράς της Google που εκτείνεται σε πολύπλοκες βάσεις κώδικα σε 20 γλώσσες προγραμματισμού, το μοντέλο έφτασε σε ποσοστό επιτυχίας που ξεπερνά το 70%.
Διασφάλιση ήδη του δικού του κώδικα της Google
Η Google λέει ότι το μοντέλο Cyber έχει ήδη αναπτυχθεί εσωτερικά και τα παραδείγματα που παρέχει είναι συγκεκριμένα:
- Η ομάδα Ασφάλειας του Chrome διαπίστωσε ότι το 3.8 Flash Cyber παρήγαγε 2,6 φορές περισσότερες σωστές ενημερώσεις κώδικα για τα τρωτά σημεία του Chrome από τα καλύτερα εμπορικά μοντέλα, τα οποία είναι πολύ μεγαλύτερα.
- Στην εταιρεία ασφαλείας Wiz, το μοντέλο πέτυχε 7,5 έως 9,7 ποσοστιαίες μονάδες υψηλότερη ανάκληση σε ένα σημείο αναφοράς δοκιμής εσωτερικής διείσδυσης σε 2,3 έως 5,2 φορές χαμηλότερο κόστος σε σύγκριση με άλλα κορυφαία μοντέλα συνόρων.
- Η ομάδα έρευνας για την ευπάθεια στο σύννεφο της Google χρησιμοποίησε το μοντέλο για να βρει μια κρίσιμη θεμελιώδη ευπάθεια σε λιγότερο από δύο ώρες — μια κατηγορία ευπάθειας της οποίας η έρευνα και η ανακάλυψη, σημειώνει η Google, συνήθως χρειάζονται μήνες.
Τι σημαίνει για τους προγραμματιστές και την αγορά
Για τους προγραμματιστές, η πρακτική λύση είναι η σταθερότητα των τιμών στο χαμηλό άκρο των συνόρων. Κρατώντας το 3.8 Flash στην αρχική τιμή του 3.7 διατηρείται το κόστος ενός ανταγωνιστικού μοντέλου κωδικοποίησης και αντιπροσώπευσης στα 0,75 $/3,75 $ ανά εκατομμύριο μάρκες, ένα τμήμα όπου οι ανταγωνιστές ανοιχτού βάρους και τα ανταγωνιστικά εργαστήρια υποτιμούν τους κατεστημένους φορείς όλο το χρόνο. Το μήνυμα της Google είναι ότι οι αγοραστές δεν χρειάζεται πλέον να επιλέγουν μεταξύ κόστους και ικανότητας στο επίπεδο εργασίας.
Το μοντέλο διανομής του προγράμματος Fairwind για το Flash Cyber είναι εξίσου χαρακτηριστικό. Τα εργαστήρια πρώτης βαθμίδας αντιμετωπίζουν ολοένα και περισσότερο την ελίτ ικανότητα κυβερνοασφάλειας ως κάτι που πρέπει να περιορίζεται αντί να αποστέλλεται ευρέως — παρέχοντας υπερσύγχρονα αμυντικά εργαλεία σε ελεγμένους υπερασπιστές, περιορίζοντας παράλληλα την πιθανότητα επιθετικής κακής χρήσης. Η απόφαση της Google να δώσει προτεραιότητα στα σημεία αναφοράς ενημέρωσης κώδικα έναντι των δυνατοτήτων εκμετάλλευσης στην εκπαίδευση του μοντέλου ακολουθεί την ίδια λογική.
Ο ρυθμός είναι επίσης αξιοσημείωτος. Τρεις εκδόσεις Flash σε έξι εβδομάδες — 3.7 Flash πριν από τρεις εβδομάδες, τώρα 3.8 — δείχνει την Google να επαναλαμβάνει τη γραμμή της μεσαίας κατηγορίας πολύ πιο γρήγορα από τους κύκλους εκδόσεων ετήσιου τύπου πριν από δύο χρόνια. Η ανταγωνιστική πίεση από την κυκλοφορία του GPT-6 του OpenAI και ένα κύμα ταχέως κινούμενων μοντέλων ανοιχτού βάρους από την Κίνα συμπίεσε τα χρονοδιαγράμματα όλων και η Google επιλέγει ξεκάθαρα την ταχύτητα στο επίπεδο εργασίας, ενώ τα συνοριακά της μοντέλα φέρουν τη σημαία της έρευνας.
Το εάν η προσέγγιση "δουλεύει σκληρότερα" του 3.8 Flash — η δαπάνη περισσότερων διακριτικών σε επιμελή συλλογιστική πολλών βημάτων — αποδεικνύεται πιο αποτελεσματική στην πράξη από την κλίμακα ακατέργαστων μοντέλων, θα εμφανιστεί στους λογαριασμούς των προγραμματιστών τους επόμενους μήνες. Τα κριτήρια αναφοράς της Google υποδηλώνουν ότι το εμπόριο μπορεί να ευνοήσει την επιμέλεια. η αγορά θα εκδώσει την ετυμηγορία της έναν λογαριασμό API κάθε φορά.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Κάθε κυκλοφορία μοντέλου, σημείο αναφοράς και αλλαγή τιμής, παρακολουθείται όπως συμβαίνει — διαβάστε περισσότερα νέα AI →
