Η xAI κυκλοφόρησε το Grok 4.7, το πιο ικανό μοντέλο της εταιρείας για κωδικοποίηση και εργασία γνώσης μέχρι σήμερα, μετά από εβδομάδες δημοσίων πειραγμάτων και τουλάχιστον μία καθυστέρηση. Ανακοινώθηκε στον ιστότοπο της εταιρείας την Κυριακή, το μοντέλο προσγειώνεται στην ίδια τιμή και ταχύτητα εξυπηρέτησης με τον προκάτοχό του Grok 4.6: 2 $ ανά εκατομμύριο μάρκες εισόδου και 6 $ ανά εκατομμύριο μάρκες εξόδου, περίπου το ήμισυ της τιμής καταλόγου του GPT-5.6 Sol Max του OpenAI (4 $/$20) και πολύ κάτω από το Anthropic's Fable 50$5.
Για τα πιο πρόσφατα νέα και αναλύσεις για την τεχνητή νοημοσύνη, επισκεφτείτε το AI Buzz Wire.
Ένα μεγαλύτερο μοντέλο βάσης, εκπαιδευμένο για μεγάλες εργασίες
Σύμφωνα με την ανακοίνωση της xAI, το Grok 4.7 χρησιμοποιεί ένα νέο, μεγαλύτερο μοντέλο βάσης σε σύγκριση με το Grok 4.6 και εκπαιδεύτηκε με μεγαλύτερη ενισχυτική μάθηση σε έναν πιο δύσκολο συνδυασμό εργασιών, σταθμισμένο σε προβλήματα που χρειάζονται πολλές ώρες για να ολοκληρωθούν. Η εταιρεία λέει ότι το μοντέλο είναι καλύτερο στην επαλήθευση της δουλειάς του και στη διαχείριση μεγαλύτερου πλαισίου και ότι εκπαιδεύτηκε να κατανοεί εγγενώς την πλεξούδα Grok Bot, βελτιώνοντας τις εργασίες συνομιλίας και τις εργασίες γενικής γνώσης.
Η κυκλοφορία ακολουθεί μια θορυβώδη πορεία. Ο Έλον Μασκ είπε αρχικά στις αρχές Σεπτεμβρίου ότι το Grok 4.7 θα προσγειωθεί εντός δέκα ημερών και στη συνέχεια αναγνώρισε στα μέσα Σεπτεμβρίου ότι το μοντέλο χρειαζόταν μερικές ακόμη μέρες βελτίωσης, σύμφωνα με το TeslaNorth.com. Τώρα αποστέλλεται και το GitHub επιβεβαίωσε την ίδια μέρα ότι το Grok 4.7 είναι διαθέσιμο στο GitHub Copilot.
Η εικόνα αναφοράς: Δυνατή, όχι σαρωτική
Τα δεδομένα αναφοράς που δημοσιεύθηκαν από το xAI δείχνουν ένα μοντέλο που ηγείται σε πολλές κατηγορίες μακροχρόνιου ορίζοντα, ενώ παραμένει πίσω από την πιο ακριβή διαμόρφωση του Anthropic σε άλλες:
- CursorBench 4.0, που δίνει έμφαση σε μακροχρόνιες εργασίες κωδικοποίησης: το Grok 4.7 σημειώνει 46,3%, μπροστά από το GPT-5.6 Sol Max (41,7%) και το Grok 4.6 High (40,4%), αλλά πίσω από το Fable 5.1 Max (51,8%).
- Terminal-Bench 4.0, πολύωρη εργασία τερματικού: 38,0%, απότομα αύξηση από 20,3% για το Grok 4,6 και μόλις μπροστά από το GPT-5,6 Sol Max (37,3%), αν και το Fable 5.1 Max προηγείται με 57,9%.
- EEBench, ένα σημείο αναφοράς ηλεκτρολογικής μηχανικής: 64,0%, ένα μεγάλο άλμα από το 53,0% του Grok 4.6 και το υψηλότερο από τα μοντέλα που αναφέρονται.
- DeepSWE v1.1: 71,0% σε υψηλή προσπάθεια, έναντι 65,2% για το Grok 4,6 και 72,7% για το GPT-5.6 Sol Max.
- AA Briefcase v1.1, πολύωρη εργασία γραφείου: 1.657, από 1.546 και κλείσιμο πίσω από το Fable 5.1 Max στα 1.678.
- Harvey Legal Agent Benchmark: 19,6%, μπροστά από το Grok 4,6 (15,8%) και πολύ μπροστά από το GPT-5,6 Sol Max (2,5%) και το Fable 5,1 Max (6,7%) σε αυτό το μέτρο.
- HealthBench Professional: 56,7%, βελτιώνοντας το 48,5% του Grok 4.6 αλλά υστερώντας σε GPT-5.6 Sol Max (60,5%) και Fable 5.1 Max (62,1%).
Στο GDPval, ένα σημείο αναφοράς επαγγελματικής γνώσης που βαθμολογείται από τον Elo, το γράφημα του xAI τοποθετεί το Grok 4,7 στο 1.695 — από 1.605 για το Grok 4.6, πίσω από το Fable 5.1 Max (1.735) και μπροστά από το GPT-6 Astra Max (1.542).
Η τιμή είναι η ιστορία
Ο πιο επιθετικός ισχυρισμός στην ανακοίνωση είναι οικονομικός και όχι τεχνικός: η xAI περιγράφει το Grok 4.7 ως δύο φορές πιο γρήγορο στη μισή τιμή συγκρίσιμων μοντέλων και ο δημοσιευμένος πίνακας τιμών υποστηρίζει τη σύγκριση με τις κορυφαίες διαμορφώσεις των δύο κύριων αντιπάλων του. Η τιμολόγηση συμβολικού του Grok 4.7 παραμένει αμετάβλητη από το Grok 4.6, κάτι που σημαίνει ότι οι αγοραστές λαμβάνουν τη βελτίωση της γενιάς χωρίς αύξηση της τιμής.
Αυτή η τοποθέτηση επεκτείνει μια στρατηγική που ακολούθησε η xAI σε όλη τη γραμμή Grok 4.x: αντιστοιχίστε ή προσεγγίστε την οριακή ποιότητα ενώ υποβιβάζετε τα premium επίπεδα τιμολόγησης των OpenAI και Anthropic και, στη συνέχεια, διανέμετε επιθετικά μέσω συνεργατών, συμπεριλαμβανομένων των GitHub, Cursor και OpenRouter.
Τι να παρακολουθήσετε
Η ειλικρινής προειδοποίηση είναι ότι η xAI δημοσίευσε το ίδιο το γράφημα σύγκρισης και η ανεξάρτητη επαλήθευση από συγκεντρωτές συγκριτικής αξιολόγησης θα διαρκέσει μέρες. Στους αριθμούς που επέλεξε να τονίσει το xAI, το Grok 4.7 είναι ένα γνήσιο βήμα από το Grok 4.6 — πιο ορατά στο Terminal-Bench 4.0 και στο EEBench — αλλά δεν σαρώνει το Fable 5.1 Max, το οποίο διατηρεί το προβάδισμα στα σημεία αναφοράς κωδικοποίησης και υγείας, ενώ κοστίζει πέντε φορές περισσότερο.
Για προγραμματιστές που εκτελούν μεγάλους φόρτους εργασίας πολλών ωρών, τα μαθηματικά τιμής-απόδοσης μπορεί να έχουν μεγαλύτερη σημασία από τη θέση του leaderboard. Το Grok 4.7 είναι τώρα διαθέσιμο μέσω του API του xAI και στο GitHub Copilot.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Για συνεχή κάλυψη των πιο σημαντικών εξελίξεων του κλάδου της τεχνητής νοημοσύνης, προσθέστε σελιδοδείκτη στο AI Buzz Wire και μην χάσετε ποτέ μια έκτακτη ιστορία.
Διαβάστε περισσότερα νέα AI