Η Inception Labs κυκλοφόρησε την Τρίτη το Mercury 2.5, μια νέα έκδοση του εμπορικού μοντέλου γλώσσας διάχυσης που η εταιρεία περιγράφει ως το πιο ικανό LLM διάχυσης στην αγορά και, από όσο γνωρίζει, το μεγαλύτερο μοντέλο γλώσσας διάχυσης που έχει εκπαιδευτεί ποτέ. Σύμφωνα με την ανακοίνωση της εταιρείας, το μοντέλο προσφέρει 40% αύξηση στην ευφυΐα σε σχέση με τον προκάτοχό του, το Mercury 2, ενώ διατηρεί το ίδιο προφίλ εξυπηρέτησης χαμηλής καθυστέρησης και χαμηλού κόστους που έχει κάνει την αρχιτεκτονική διάχυσης ελκυστική για φόρτους εργασίας μεγάλου όγκου.
Η εταιρεία, με επικεφαλής τον Διευθύνοντα Σύμβουλο Stefano Ermon, ισχυρίζεται ότι το Mercury 2.5 είναι συγκρίσιμο με βελτιστοποιημένα οικονομικά μοντέλα συνόρων, όπως τα GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite και Claude Haiku 4.5. Αυτές οι συγκρίσεις αναφέρονται από τον προμηθευτή και δεν έχουν ακόμη επαληθευτεί από ανεξάρτητους δείκτες αναφοράς, αλλά τοποθετούν ένα μοντέλο διάχυσης - εδώ και πολύ καιρό μια ερευνητική περιέργεια - ως εναλλακτική λύση παραγωγής σε σχέση με τους κατεστημένους φορείς με αυτοπαλίνδρομο. Για τα τελευταία νέα μοντέλα τεχνητής νοημοσύνης, ακολουθήστε τη συνεχή κάλυψη μοντέλων του AI Buzz Wire. τελευταία νέα μοντέλα τεχνητής νοημοσύνης
Ταχύτητα, πλαίσιο και τιμή
Οι αριθμοί των επικεφαλίδων είναι επιθετικοί. Η Inception Labs λέει ότι το Mercury 2.5 παράγει 1.107 tokens ανά δευτερόλεπτο σε ευρέως διαθέσιμες GPU της NVIDIA, με παράθυρο περιβάλλοντος 260.000 tokens. Η τιμολόγηση έχει οριστεί σε 0,20 $ ανά εκατομμύριο μάρκες εισόδου και 0,75 $ ανά εκατομμύριο μάρκες εξόδου, με μια προώθηση εκκίνησης με έκπτωση 80% στο μοντέλο σε 0,04 $ ανά εκατομμύριο εισροές και 0,15 $ ανά εκατομμύριο μάρκες.
Από την πλευρά των δυνατοτήτων, το μοντέλο συνοδεύεται από συντονίσιμα συλλογιστικά — επιτρέποντας στους προγραμματιστές να ανταλλάσσουν τον λανθάνοντα χρόνο με το βάθος με βάση το αίτημα — μαζί με παράλληλες κλήσεις εργαλείων και εξόδου JSON ευθυγραμμισμένα με σχήματα για δομημένη παραγωγή. Η εταιρεία χαρακτηρίζει την κυκλοφορία ως το πρώτο αποτέλεσμα ενός εκπαιδευτικού βρόχου που καθοδηγείται από την τηλεμετρία παραγωγής: από τότε που κυκλοφόρησε το Mercury 2, χιλιάδες προγραμματιστές έχουν δημιουργήσει με αυτό, δεκάδες επιχειρήσεις το έχουν αναπτύξει και η χρήση έχει αυξηθεί κατά περισσότερο από μια τάξη μεγέθους.
Γιατί τα μοντέλα διάχυσης δημιουργούν κείμενο πιο γρήγορα
Τα κύρια LLM από το OpenAI, το Google και το Anthropic είναι αυτοπαλινδρομικά: δημιουργούν κείμενο ένα διακριτικό τη φορά, με κάθε διακριτικό να εξαρτάται από όλα όσα έχουν δημιουργηθεί πριν από αυτό. Αυτή η διαδοχική εξάρτηση βάζει ένα σκληρό πάτωμα κάτω από την ταχύτητα παραγωγής. Αντίθετα, τα μοντέλα γλώσσας διάχυσης ξεκινούν με ένα μπλοκ θορύβου και βελτιώνουν επαναληπτικά όλα τα διακριτικά παράλληλα, κάτι που επιτρέπει πολύ υψηλότερη απόδοση σε συμβατικό υλικό GPU, μόλις το μοντέλο εκπαιδευτεί να συγκλίνει καθαρά.
Η αντιστάθμιση ήταν ιστορικά η ποιότητα: τα μοντέλα διάχυσης έχουν ακολουθήσει τα αυτοπαλινδρομικά όσον αφορά τη συλλογιστική και τα κριτήρια αναφοράς που ακολουθούν τις οδηγίες. Το βασικό στοίχημα της Inception Labs — και ο ισχυρισμός που διέπει το Mercury 2.5 — είναι ότι αυτό το χάσμα έχει μειωθεί στο σημείο όπου η διάχυση κερδίζει στον άξονα που πραγματικά νιώθουν οι περισσότεροι πελάτες: καθυστέρηση και κόστος σε όγκο παραγωγής.
Αξιώσεις Παραγωγής Από Πρώιμους Πελάτες
Η ανακοίνωση βασίζεται σε μεγάλο βαθμό στις αναπτύξεις πελατών και όχι στους πίνακες συγκριτικής αξιολόγησης. Η OpenCall, η οποία κατασκευάζει τηλεφωνικούς πράκτορες τεχνητής νοημοσύνης για ζωντανές κλήσεις πελατών, ανέφερε ότι η μετάβαση στο Mercury ανέβασε τη μέση καθυστέρηση απόκρισης του μοντέλου σε περίπου 170 χιλιοστά του δευτερολέπτου. Ο Oliver Silverstein, συνιδρυτής και Διευθύνων Σύμβουλος του OpenCall, είπε ότι ο χρόνος απόκρισης P99 της εταιρείας μειώθηκε από αρκετά λεπτά σε ένα δευτερόλεπτο και ο διάμεσος από 0,4 δευτερόλεπτα σε λιγότερο από 0,2 - στοιχεία που περιέγραψε ως σημαντικά ταχύτερα από οποιονδήποτε άλλο πάροχο που είχε δοκιμάσει η εταιρεία, συμπεριλαμβανομένου του συλλογισμού ενεργοποιημένη.
Ο Augment Code, ένας κατασκευαστής βοηθών κωδικοποίησης AI, χρησιμοποιεί το Mercury για συμπίεση περιβάλλοντος, δρομολόγηση μοντέλου και αναζήτηση εργαλείων MCP. Σύμφωνα με τα Inception Labs, η μεταφορά φόρτου εργασίας συμπίεσης στο Mercury μείωσε την καθυστέρηση αυτού του βήματος κατά 82%, από περίπου 150 δευτερόλεπτα σε 27 δευτερόλεπτα και μείωσε το κόστος του κατά 90% διατηρώντας παράλληλα την ποιότητα. Η περίπτωση χρήσης δείχνει πού δαγκώνουν τα οικονομικά: οι πράκτορες κωδικοποίησης πραγματοποιούν πολλές μικρές κλήσεις υποστηρικτικών μοντέλων γύρω από κάθε κύρια γενιά και η καθυστέρηση και το κόστος συνδυάζονται σε αυτές τις κλήσεις.
Η NVIDIA, της οποίας το υλικό τρέχει το μοντέλο, στάθηκε επίσης.
Προεπισκοπήσεις Mercury Voice και Mercury Router
Παράλληλα με το μοντέλο, η Inception Labs ανακοίνωσε προεπισκοπήσεις δύο νέων προϊόντων. Το Mercury Voice είναι ένα LLM διάχυσης βελτιστοποιημένο για φωνητικούς πράκτορες με τους πιο περιορισμένους προϋπολογισμούς λανθάνοντος χρόνου, διαφημίζοντας χρόνο έως το πρώτο διακριτικό κάτω από 170 χιλιοστά του δευτερολέπτου. Το Mercury Router χρησιμοποιεί ένα μοντέλο διάχυσης για να κατανοεί τις εισερχόμενες προτροπές και να τις δρομολογεί σε όποιο μοντέλο —ανοιχτό ή κλειστό— προσφέρει τον καλύτερο συνδυασμό ποιότητας, ταχύτητας και κόστους, τοποθετώντας το Inception ως ένα επίπεδο πάνω από τους ανταγωνιστές του καθώς και από έναν από αυτούς.
Το Mercury 2.5 είναι διαθέσιμο μέσω του API της Inception καθώς και μέσω του Baseten και του OpenRouter. Οι εταιρικές αναπτύξεις προσθέτουν αποκλειστική χωρητικότητα, αυτόματη κλιμάκωση, ελέγχους συμμόρφωσης και παραμετροποιήσιμη διατήρηση δεδομένων. Η εταιρεία προσφέρει 100 εκατομμύρια δωρεάν διακριτικά σε προγραμματιστές που δοκιμάζουν το API.
Η εταιρεία είπε επίσης ότι έχει ήδη αρχίσει να εκπαιδεύει το επόμενο μοντέλο της - το μεγαλύτερο μέχρι τώρα, που έχει στόχο να κυκλοφορήσει τους επόμενους μήνες - το οποίο περιγράφει ως ένα άλμα στην ικανότητα που δεν αφήνει τίποτα από την ταχύτητα της διάχυσης ή την αποτελεσματικότητα. Εάν αυτός ο ισχυρισμός ισχύει, η πίεση στους κατεστημένους φορείς με αυτοπαλίνδρομο θα γίνει αισθητή πρώτα στις βαθμίδες εμπορευμάτων της αγοράς, όπου η τιμή και η καθυστέρηση καθορίζουν τα περισσότερα συμβόλαια.
Μείνε μπροστά από την τεχνητή νοημοσύνη
Ακολουθήστε τις τελευταίες εξελίξεις της τεχνητής νοημοσύνης και τις έκτακτες ειδήσεις της τεχνητής νοημοσύνης καθώς οι αρχιτεκτονικές νέων μοντέλων έρχονται στην παραγωγή.
Διαβάστε περισσότερα νέα AI →