Η Cerebras πρόσθεσε το Qwen 3.8 27B στα δημόσια τελικά σημεία της πλατφόρμας Cerebras Inference, όπου το μοντέλο ανοιχτού βάρους εκτελείται με περίπου 1.500 tokens ανά δευτερόλεπτο, σύμφωνα με την τεκμηρίωση του καταλόγου μοντέλων της εταιρείας. Η καταχώριση καθιστά διαθέσιμη μία από τις πιο ευρέως χρησιμοποιούμενες οικογένειες ανοιχτών μοντέλων της Alibaba σε ταχύτητες που ξεπερνούν τις τυπικές υπηρεσίες που φιλοξενούνται από GPU.

Η ανακοίνωση τράβηξε αμέσως την προσοχή των προγραμματιστών: η ιστορία συγκέντρωσε περισσότερους από 600 πόντους στο Hacker News μέσα σε μια μέρα, ένα επίπεδο έλξης που αντικατοπτρίζει πόσο καυτή έχει γίνει η ζήτηση για γρήγορα και φθηνά συμπεράσματα. Για μια ευρύτερη άποψη της αγοράς συμπερασμάτων, το γραφείο έκτακτες ειδήσεις AI ακολουθεί κάθε σημαντική ενημέρωση πλατφόρμας καθώς προσγειώνεται.

Οι προδιαγραφές στον κατάλογο

Σύμφωνα με την τεκμηρίωση της Cerebras, το Qwen 3.8 27B φέρει 27 δισεκατομμύρια παραμέτρους και υποστηρίζει 64.000 tokens περιβάλλοντος στο δωρεάν επίπεδο και 128.000 σε επί πληρωμή επίπεδα, που τρέχουν με περίπου 1.500 tokens ανά δευτερόλεπτο. Βρίσκεται δίπλα στο ανοιχτού βάρους μοντέλο GPT-OSS 120B του OpenAI, το οποίο ο ίδιος κατάλογος παραθέτει με περίπου 3.000 tokens ανά δευτερόλεπτο με 65K πλαίσιο στη δωρεάν βαθμίδα και 131K σε πληρωμένες βαθμίδες.

Και τα δύο μοντέλα είναι διαθέσιμα σε δωρεάν δοκιμαστικές βαθμίδες και pay-as-you-go της Cerebras, με την επιφύλαξη ορίων τιμών. Οι πελάτες που χρειάζονται δεσμευμένη χωρητικότητα, υψηλότερη απόδοση ή SLA παραγωγής κατευθύνονται στην προσφορά Dedicated Endpoints της εταιρείας, την οποία η τεκμηρίωση παραθέτει επίσης ως τη διαδρομή προς πρόσθετες οικογένειες μοντέλων πέρα ​​από τις δύο σε δημόσια τελικά σημεία.

Τα παράθυρα περιβάλλοντος αξίζουν την προσοχή μαζί με τα στοιχεία ταχύτητας. Εξήντα τέσσερις χιλιάδες μάρκες στη δωρεάν βαθμίδα — και 128.000 επί πληρωμή — είναι αρκετά για να κρατούν ταυτόχρονα μεγάλες βάσεις κωδικών, μεγάλα έγγραφα ή εκτεταμένες μεταγραφές πρακτόρων στη μνήμη, κάτι που έχει σημασία για τον ακριβή φόρτο εργασίας όπου η γρήγορη αποκωδικοποίηση αποδίδει. Η τεκμηρίωση της Cerebras περιλαμβάνει επίσης έναν οδηγό συμβατότητας OpenAI, μειώνοντας το κόστος εναλλαγής για ομάδες των οποίων ο υπάρχων κώδικας στοχεύει ήδη το OpenAI SDK: κατ' αρχήν, η κατάδειξη ενός υπάρχοντος πελάτη σε ένα τελικό σημείο Cerebras είναι μια αλλαγή διαμόρφωσης και όχι μια επανεγγραφή.

Μη κλαδευμένα μοντέλα, διαφανής συμπίεση

Μια λεπτομέρεια που αξίζει να σημειωθεί στην τεκμηρίωση είναι η αποκάλυψη της Cerebras για το πώς χειρίζεται τη συμπίεση του μοντέλου. Η εταιρεία δηλώνει ότι όλα τα μοντέλα στα δημόσια τελικά σημεία της είναι πρωτότυπες, μη κλαδευμένες εκδόσεις και ότι χρησιμοποιεί επιλεκτική κβαντοποίηση μόνο με βάρος μόνο κατά την αποθήκευση για να διατηρήσει την ποιότητα. Τα ευαίσθητα στρώματα παραμένουν σε πλήρη ακρίβεια, οι ενεργοποιήσεις, η προσοχή και η κρυφή μνήμη KV παραμένουν μη κβαντοποιημένες και η αποκβάντωση γίνεται εν κινήσει.

Η Cerebras αποκαλύπτει επίσης την έρευνά της σε τεχνικές κλαδέματος όπως το REAP (Router-weighted Expert Activation Pruning): οι κλαδευμένες παραλλαγές κοινοποιούνται στην ερευνητική κοινότητα στο Hugging Face, αλλά δεν παρέχονται μέσω του δημόσιου API. Για τους προγραμματιστές που επιλέγουν πού να εκτελούν ανοιχτά μοντέλα, αυτή η διαφάνεια σχετικά με το τι ακριβώς εμφανίζεται είναι ασυνήθιστα σαφής.

Γιατί η ταχύτητα συμβολικής έχει σημασία

Οι αριθμοί διεκπεραίωσης όπως αυτοί έχουν μεγαλύτερη σημασία για φόρτους εργασίας αντιπροσώπων και κωδικοποίησης. Οι εφαρμογές που συνδυάζουν εκατοντάδες κλήσεις μοντέλων — πράκτορες κωδικοποίησης, αυτόνομες ροές εργασίας, βοηθοί σε πραγματικό χρόνο — πολλαπλασιάζουν τον λανθάνοντα χρόνο ανά διακριτικό σε κάθε βήμα, έτσι ώστε η διαφορά μεταξύ 50 και 1.500 μάρκες ανά δευτερόλεπτο να συνδυάζεται σε μια ποιοτικά διαφορετική εμπειρία. Οι διαδραστικές εφαρμογές που μεταδίδουν μακροχρόνιες ολοκληρώσεις ωφελούνται περισσότερο ορατά.

Η αντιστάθμιση είναι πεδίο εφαρμογής. Ένα μοντέλο 27 δισεκατομμυρίων παραμέτρων δεν θα ταιριάζει με τα συνοριακά συστήματα στις πιο δύσκολες συλλογιστικές εργασίες, και τα ίδια τα έγγραφα της Cerebras κατευθύνουν βαρύ φόρτο εργασίας παραγωγής προς αποκλειστική χωρητικότητα. Αλλά για το μεγάλο μεσαίο έδαφος των εργασιών όπου τα ανοιχτά μοντέλα μεσαίου μεγέθους είναι ήδη αρκετά καλά — σύνοψη, ταξινόμηση, χρήση εργαλείων, επεξεργασία κώδικα — η ταχύτητα γίνεται ο διαφοροποιητής.

Υπάρχει επίσης μια διάσταση τιμής που θα σταθμίσουν οι προγραμματιστές. Τα δημόσια μοντέλα τελικού σημείου μπορούν να χρησιμοποιηθούν σε μια δωρεάν δοκιμή πριν από οποιαδήποτε δέσμευση, γεγονός που καθιστά τη συγκριτική αξιολόγηση έναντι του φόρτου εργασίας μιας ομάδας ουσιαστικά χωρίς τριβές — μια σκόπιμη on-ramp που έρχεται σε αντίθεση με τις εταιρικές συμβάσεις που απαιτούν συνομιλίες πωλήσεων πριν από την προβολή του πρώτου διακριτικού. Τα τεκμηριωμένα όρια ρυθμών είναι ο περιορισμός που πρέπει να παρακολουθείτε: η ελεύθερη πρόσβαση υπάρχει για να αποδεικνύεται η ταχύτητα και όχι για να εκτελείται η κυκλοφορία παραγωγής.

A Busy Stretch για ανοιχτά μοντέλα

Η προσθήκη προσγειώνεται κατά τη διάρκεια μιας πολυσύχναστης διαδρομής για AI ανοιχτών βαρών. Το εργαστήριο IFM με έδρα τα Ηνωμένα Αραβικά Εμιράτα μόλις παρουσίασε το K2 Horizon, έναν συνδεδεμένο στόλο έξι πλήρως ανοιχτών μοντέλων, και η Meta συνεχίζει να επαναλαμβάνει την οικογένεια Muse για κωδικοποίηση και χρήση αντιπροσώπων. Εν τω μεταξύ, τα οικοσυστήματα ανοιχτού μοντέλου στην Κίνα συνεχίζουν να αποστέλλονται με ρυθμό που έχει συμπιέσει τους κύκλους απελευθέρωσης σε ολόκληρο τον κλάδο.

Για τους προγραμματιστές, η πρακτική λύση είναι ότι η στοίβα ανοιχτών μοντέλων ωριμάζει ταυτόχρονα σε δύο μέτωπα: ικανότητα, καθώς τα μοντέλα μεσαίου μεγέθους κλείνουν τα κενά με τις ναυαρχίδες σε καθημερινές εργασίες και εξυπηρέτηση οικονομικών, καθώς οι εξειδικευμένοι πάροχοι συμπερασμάτων ανταγωνίζονται με ακατέργαστη ταχύτητα. Το Qwen 3.8 27B στο Cerebra είναι ένα σημείο δεδομένων και για τις δύο τάσεις — ένα ανοιχτό μοντέλο τρέχουσας γενιάς που εξυπηρετούνταν σε ταχύτητες που ήταν εξωτικές πριν από ένα χρόνο, σε υλικό που κατασκευάστηκε ειδικά για τη δουλειά.

Οι προγραμματιστές που αξιολογούν την πλατφόρμα θα πρέπει να συγκρίνουν τους δικούς τους φόρτους εργασίας: οι δημοσιευμένες ταχύτητες είναι αριθμητικά στοιχεία καταλόγου, η απόδοση του πραγματικού κόσμου εξαρτάται από τα μήκη, τη συγχρονικότητα και τις ρυθμίσεις παραμέτρων και τα όρια ρυθμού της δωρεάν βαθμίδας θα δεσμευτούν πριν από την ταχύτητά της.

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Κάθε έκδοση μοντέλου, ενημέρωση πλατφόρμας συμπερασμάτων και εκκίνηση εργαλείου προγραμματιστή, παρακολουθούνται όπως συμβαίνει — διαβάστε περισσότερα νέα AI →