Η OpenAI κυκλοφόρησε το GPT-6.1 Sol στις 29 Σεπτεμβρίου, αποσύροντας το GPT-6 Sol μόλις επτά ημέρες μετά το ντεμπούτο αυτού του μοντέλου, σύμφωνα με την ανεξάρτητη εταιρεία συγκριτικής αξιολόγησης Artificial Analysis. Η ανταλλαγή συνέπεσε με το συνέδριο προγραμματιστών DevDay της εταιρείας, όπου το CNET ανέφερε ότι οι συμμετέχοντες θα μπορούσαν να αρχίσουν να χρησιμοποιούν το GPT-6.1 Sol αμέσως μαζί με τους πράκτορες Dots που κυκλοφόρησαν πρόσφατα και ένα σύνολο αλλαγών συνδρομής.
Μια επταήμερη αντικατάσταση από ναυαρχίδα σε ναυαρχίδα είναι ασυνήθιστη ακόμη και για τα επιταχυνόμενα πρότυπα του 2026 και τα σημεία αναφοράς υποδηλώνουν γιατί το OpenAI κινήθηκε γρήγορα. Για συνεχή κάλυψη των κυκλοφοριών μοντέλων, των αγώνων αναφοράς και του πολέμου τιμών κάτω από αυτά, το AI Buzz Wire παρακολουθεί τις εξελίξεις που έχουν σημασία καθώς συμβαίνουν.
Ένα μετρήσιμο άλμα σε επτά ημέρες
Η Τεχνητή Ανάλυση αναφέρει ότι το GPT-6.1 Sol κερδίζει 4 πόντους στον δείκτη νοημοσύνης της εταιρείας έναντι του GPT-6 Sol και 5 πόντους έναντι του GPT-5.6 Sol, προσγειωμένος μόλις 1 πόντο κάτω από το GPT-6 Astra, το πιο ικανό μοντέλο της OpenAI. Η αξιολόγηση της εταιρείας συνδυάζει τη συλλογιστική, τη γνώση, τα μαθηματικά και τις πρακτορικές εργασίες σε μια ενιαία συγκριτική βαθμολογία.
Οι επιμέρους βαθμολογίες δείχνουν πού συγκεντρώνονται τα κέρδη. Το GPT-6.1 Sol βελτίωσε 4 πόντους στο AA-Briefcase v1.1 και 5 πόντους στο GDPval-AA v2.1, και τα δύο δοκιμάζουν τις γνώσεις πράκτορα. Ένα άλμα 12 βαθμών στο Terminal-Bench 4.0 δείχνει ουσιαστικά καλύτερη απόδοση σε πραγματικά περιβάλλοντα τερματικού, ενώ το Humanity's Last Exam αυξήθηκε κατά 5 βαθμούς και το GDP.pdf αυξήθηκε κατά 6.
Ένας αριθμός ξεχωρίζει για όποιον χρησιμοποιεί μοντέλα για έρευνα: η ακρίβεια στο AA-Omniscience ανέβηκε 8 πόντους ενώ το ποσοστό ψευδαισθήσεων μειώθηκε από 60 τοις εκατό σε 54 τοις εκατό. Και τα δύο στοιχεία παραμένουν υψηλά σε απόλυτες τιμές, αλλά η κατεύθυνση του ταξιδιού έχει σημασία για τις ροές εργασίας όπου μια σίγουρη λάθος απάντηση είναι χειρότερη από τη μη απάντηση.
Ίδια τιμή αυτοκόλλητου, φθηνότερο στην πράξη
Όσον αφορά την τιμολόγηση, το GPT-6.1 Sol διατηρεί την κάρτα τιμών της GPT-6 Sol με 2 $ ανά εκατομμύριο διακριτικά εισόδου και 10 $ ανά εκατομμύριο μάρκες εξόδου, αλλά η έκπτωση ανάγνωσης προσωρινής μνήμης αυξάνεται από 90 τοις εκατό σε 95 τοις εκατό. Η Artificial Analysis σημειώνει ότι η μικτή τιμή του GPT-6.1 Sol για φόρτους εργασίας αντιπροσώπων είναι επομένως ελαφρώς χαμηλότερη από αυτή της GPT-6 Sol, επεκτείνοντας μια σειρά από αποτελεσματικές περικοπές τιμών που ξεκίνησε όταν το GPT-6 Sol κυκλοφόρησε με έκπτωση 50 τοις εκατό στο GPT-5.6 Sol.
Η τροχιά των τιμών είναι η πραγματική ιστορία εδώ. Μέσα σε δύο εκδόσεις, το OpenAI μείωσε περίπου στο μισό το πραγματικό κόστος της γραμμής συνόρων μεσαίας βαθμίδας του δύο φορές, ενώ ωθεί την ποιότητα προς τα πάνω κάθε φορά.
Κόστος ανά εργασία: 0,72 $ έναντι 3,26 $
Το κόστος ανά εργασία είναι εκεί όπου το χάσμα με το GPT-6 Astra γίνεται έντονο. Με μέγιστη προσπάθεια, η Τεχνητή Ανάλυση δεσμεύει το GPT-6.1 Sol σε 0,72 $ ανά εργασία Ευρετηρίου Ευφυΐας, λιγότερο από το ένα τέταρτο των 3,26 $ του GPT-6 Astra. Σε σχέση με τον προκάτοχό του, η εξοικονόμηση είναι 31 τοις εκατό (1,05 $ για το GPT-6 Sol) και έναντι του GPT-5,6 Sol φτάνουν το 64 τοις εκατό (1,99 $).
Σύμφωνα με την εταιρεία, κάθε επίπεδο προσπάθειας του GPT-6.1 Sol ξεπερνά τα σύνορα του Pareto ως προς το κόστος – που σημαίνει ότι για ένα δεδομένο επίπεδο νοημοσύνης, δεν υπάρχει φθηνότερη επιλογή μεταξύ των μοντέλων που παρακολουθεί. Η εικόνα της απόδοσης του token είναι πιο μικτή: Το GPT-6.1 Sol καταναλώνει περίπου 10 έως 30 τοις εκατό περισσότερα tokens εξόδου από το GPT-6 Sol σε όλα τα επίπεδα προσπάθειας, αν και οι ρυθμίσεις χαμηλής και μέσης προσπάθειας παραμένουν βέλτιστες σε Pareto για την αποτελεσματικότητα του token, αφού ληφθεί υπόψη η υψηλότερη ευφυΐα. Στην κωδικοποίηση, το μοντέλο κέρδισε 3 πόντους Sol agent σε μέγιστο κόπο XPT.
Γιατί έχει σημασία η ανάκαμψη των επτά ημερών
Η ευρύτερη πλάκα του DevDay ενισχύει την ίδια εικόνα. Η αναφορά του CNET πλαισίωσε το συνέδριο γύρω από τρία πράγματα που οι προγραμματιστές θα μπορούσαν να χρησιμοποιήσουν αμέσως - GPT-6.1 Sol, τους πράκτορες Dots και επανασχεδιασμένα σχέδια συνδρομής - αντί για μια μακρινή προεπισκόπηση έρευνας. Το μήνυμα προς τους προγραμματιστές ήταν η διαθεσιμότητα σήμερα, όχι η δυνατότητα αύριο.
Το Flagship εκπέμπει αυτό το σύντομο μήνυμα ότι ο ανταγωνιστικός περιορισμός έχει μετατοπιστεί από τις διαδρομές εκπαίδευσης στη βελτίωση της υποδομής μετά την εκπαίδευση και την εξυπηρέτηση. Μια αναβάθμιση σε επίπεδο σημείου που αποστέλλεται σε μια εβδομάδα μοιάζει περισσότερο με ένα βελτιστοποιημένο σημείο ελέγχου και ένα νέο φύλλο τιμών παρά με ένα μοντέλο εκ των υστέρων, και οι ανταγωνιστές συμπεριφέρονται με τον ίδιο τρόπο: η Google ανακοίνωσε το Gemini 4 Argon στις 30 Σεπτεμβρίου, ένα μοντέλο συνόρων που αρχικά προσεγγίζει αξιόπιστους υπερασπιστές στον κυβερνοχώρο μέσω του προγράμματος Fairwind με την ίδια τιμή 10 ανά 2 εκατομμύριο $/$.
Για τους προγραμματιστές, ακολουθούν τρία πρακτικά στοιχεία από τους επαληθευμένους αριθμούς. Πρώτον, οι πρακτικοί φόρτοι εργασίας με μεγάλη επαναχρησιμοποίηση της προσωρινής μνήμης επωφελούνται αμέσως από την έκπτωση 95 τοις εκατό στην προσωρινή μνήμη. Δεύτερον, οι προϋπολογισμοί θα πρέπει να μοντελοποιούν την υψηλότερη κατανάλωση διακριτικού παραγωγής πριν από τη μετεγκατάσταση, καθώς η τιμή ανά διακριτικό παραμένει αμετάβλητη ακόμη και όταν το μοντέλο σκέφτεται περισσότερο. Τρίτον, το Astra παραμένει το ανώτατο όριο για εργασίες όπου το τελευταίο σημείο ευφυΐας αξίζει 4 φορές το κόστος - Η περίπτωση του GPT-6.1 Sol είναι ότι για τις περισσότερες εργασίες δεν ισχύει.
Η προειδοποίηση που αξίζει να επαναληφθεί: αυτά τα στοιχεία προέρχονται από έναν μόνο ανεξάρτητο αξιολογητή, όσο αυστηρή κι αν είναι η μεθοδολογία του, και οι βαθμολογίες ευρετηρίου ανταμείβουν συγκεκριμένους συνδυασμούς φόρτου εργασίας. Ομάδες με απαιτητικό φόρτο εργασίας θα πρέπει να επαναλάβουν τις δικές τους αξιολογήσεις προτού επαναδρομολογήσουν την κυκλοφορία παραγωγής.
---
Μείνετε μπροστά από την τεχνητή νοημοσύνηΛάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →