Η Cerebras αποκάλυψε το CS-4, ένα σύστημα συμπερασμάτων τεχνητής νοημοσύνης σε κλίμακα rack που έχει δημιουργηθεί γύρω από τον νέο επεξεργαστή κλίμακας wafer WSE-3 Turbo, υποστηρίζοντας ότι το μηχάνημα παρέχει έως και 30 φορές ταχύτερα συμπεράσματα από τα συστήματα που βασίζονται σε GPU, καθώς η εταιρεία τοποθετείται ως η εναλλακτική λύση ταχύτητας στην αυτοκρατορία των κέντρων δεδομένων της Nvidia.

Η κυκλοφορία, που ανακοινώθηκε την Τρίτη και περιγράφεται λεπτομερώς στις σελίδες προϊόντων της εταιρείας και ένα κύμα κάλυψης από το Reuters, το Bloomberg και το The Register, σηματοδοτεί τη σημαντικότερη ανανέωση υλικού της Cerebras από τότε που βγήκε στο χρηματιστήριο — και μια κομβική στιγμή για μια εταιρεία της οποίας η μετοχή έχει δυσκολευτεί από την IPO της. Οι επενδυτές φαίνεται να δίνουν προσοχή: οι μετοχές της Cerebras (CBRS) αυξήθηκαν στις ειδήσεις και η Investor's Business Daily ανέφερε το σχόλιο του Διευθύνοντος Συμβούλου ότι η αγορά συμπερασμάτων τεχνητής νοημοσύνης «αυξάνεται τόσο γρήγορα».

Για τους αναγνώστες που παρακολουθούν την επιταχυνόμενη κούρσα για να κάνουν τα μοντέλα τεχνητής νοημοσύνης να ανταποκρίνονται γρηγορότερα, η κυκλοφορία του CS-4 είναι μια από τις πιο σημαντικές ιστορίες υλικού του τριμήνου και προσγειώνεται εν μέσω ευρύτερων αλλαγών στην κάλυψη της βιομηχανίας τεχνητής νοημοσύνης που συνεχίζουν να αναδιαμορφώνουν το τοπίο υπολογιστών.

Τι υπάρχει μέσα στο CS-4

Το βασικό συστατικό είναι το WSE-3 Turbo, μια αναβαθμισμένη έκδοση της μηχανής Wafer Scale Engine της Cerebras σε μέγεθος πιάτου. Σύμφωνα με την τεχνική βαθιά κατάδυση του The Register, το WSE-3T δεν είναι καινούργιο πυρίτιο — διατηρεί την ίδια διαδικασία TSMC 5nm, επιφάνεια μήτρας 46.225 τετραγωνικών χιλιοστών, 4 τρισεκατομμύρια τρανζίστορ, 900.000 πυρήνες και 44 GB on-wafer SRAM με το δύο ετών WSE-3.

Αντίθετα, η Cerebras πέτυχε τον διπλασιασμό της απόδοσής της πιέζοντας το υπάρχον τσιπ πολύ πιο σκληρά. Το WSE-3T διπλασιάζει τον αραιό υπολογισμό FP16 στα 250 petaFLOPS, διπλασιάζει την πυκνή απόδοση του FP16 σε περίπου 25 petaFLOPS, διπλασιάζει το εύρος ζώνης μνήμης στα 43,2 petabyte ανά δευτερόλεπτο και διπλασιάζει το εύρος ζώνης I/O σε 2,4 terabit ανά δευτερόλεπτο. Το Register εκτιμά ότι η εταιρεία χρονίζει τώρα το πυρίτιο σε περίπου 2,8 GHz, από περίπου 1,4 GHz στην προηγούμενη γενιά.

Το κόλπο, σύμφωνα με την Cerebras, είναι ένα επανασχεδιασμένο σύστημα παροχής ισχύος που βρίσκεται σε απόσταση μόλις 0,5 χιλιοστών από τον επεξεργαστή — περίπου 100 φορές πιο κοντά από τα ~50 χιλιοστά που είναι τυπικά για τις συμβατικές πλακέτες GPU. Αυτή η εγγύτητα σχεδόν εξαλείφει την απώλεια ισχύος σε επίπεδο πλακέτας και επιτρέπει τη διπλάσια ισχύ για να φτάσει στη γκοφρέτα, επιτρέποντας τις υψηλότερες συχνότητες λειτουργίας πίσω από ταχύτερη παραγωγή διακριτικών.

Η αρχιτεκτονική Nexus Rack

Πέρα από το ίδιο το τσιπ, το CS-4 εισάγει αυτό που η Cerebras αποκαλεί Nexus Platform Architecture, τον πρώτο του αληθινό σχεδιασμό σε κλίμακα rack και μια άμεση απάντηση στα συστήματα rack Nvidia NVL72 και Helios της AMD. Κάθε CS-4 μπορεί να μεταφέρει έως και τρεις επεξεργαστές WSE-3T που φιλοξενούνται σε αυτόνομα "Wafer-Scale Backpacks" — πακέτα 3D που διπλώνουν τη γκοφρέτα, μετατροπή ισχύος, άμεση ψύξη υγρών, I/O υψηλής ταχύτητας και ηλεκτρονικά ελέγχου σε ένα συγκρότημα με 50% λιγότερα εξαρτήματα.

Ο αρθρωτός σχεδιασμός διαχωρίζει τη σταθερή ισχύ, την ψύξη και το επίπεδο δικτύου από τον υπολογισμό. Ένα Cerebras PowerRack μπορεί να εγκατασταθεί και να πιστοποιηθεί για τις εγκαταστάσεις πριν φτάσει οποιοσδήποτε υπολογισμός και τα σακίδια στη συνέχεια γλιστρούν στη θέση τους — μειώνοντας τον χρόνο ανάπτυξης από ημέρες σε ώρες, σύμφωνα με την εταιρεία.

Η κατανάλωση ρεύματος είναι σημαντική. Το Register υπολογίζει περίπου 46 kW ανά σακίδιο και συνολική ισχύ συστήματος από 120 έως 140 kW — εντυπωσιακοί αριθμοί που ωστόσο φαίνονται συντηρητικοί δίπλα στα συστήματα rack 240 έως 250 kW AMD και Nvidia αναμένεται να κυκλοφορήσουν αργότερα φέτος.

Σκότωμα του διακόπτη

Ίσως η πιο ενδιαφέρουσα τεχνικά επιλογή είναι η διασύνδεση. Αντί να δρομολογεί την κυκλοφορία wafer-to-wafer μέσω διακοπτών - η προσέγγιση που υιοθετήθηκε από το AWS για τους επιταχυντές Trainium3 - η Cerebras συνδέει τα τσιπ της σε μια τοπολογία 2D torus όπου οι γειτονικές γκοφρέτες συνομιλούν απευθείας μεταξύ τους. Ο σχεδιασμός μειώνει τον λανθάνοντα χρόνο από γκοφρέτα σε γκοφρέτα από πέντε μικροδευτερόλεπτα σε μόλις δύο και η Cerebras λέει ότι το πλέγμα μπορεί να υποστηρίξει μοντέλα έως και 50 τρισεκατομμυρίων παραμέτρων, άνετα πέρα ​​από οτιδήποτε υπάρχει αυτή τη στιγμή.

Τα αποτελέσματα της ταχύτητας είναι εντυπωσιακά. Σε ένα μόνο σύστημα CS-4, η εταιρεία συγκριτικής αξιολόγησης Artificial Analysis μέτρησε έως και 4.400 tokens ανά δευτερόλεπτο ανά χρήστη στο gpt-oss-120b — περίπου 12 φορές τα ~350 tokens ανά δευτερόλεπτο από τις ταχύτερες υπηρεσίες συμπερασμάτων που βασίζονται σε GPU που είναι διαθέσιμες σήμερα. Η Cerebras ισχυρίζεται επίσης ότι το σύστημα διατηρεί περισσότερα από 1.000 tokens ανά δευτερόλεπτο σε μοντέλα που υπερβαίνουν τα 10 τρισεκατομμύρια παραμέτρους.

Μια διαχωρισμένη στρατηγική εταιρικής σχέσης

Σημειωτέον, η Cerebras δεν προσπαθεί πλέον να τρέξει ολόκληρο τον αγωγό συμπερασμάτων με το δικό του πυρίτιο. Η εταιρεία συνεργάστηκε με την AWS και την AMD για να μεταφορτώσει το εντατικό υπολογιστικό στάδιο άμεσης επεξεργασίας συμπερασμάτων σε Trainium XPU και Instinct GPU αντίστοιχα, αφήνοντας τους κινητήρες κλίμακας wafer να χειρίζονται την ευαίσθητη σε καθυστέρηση φάση αποκωδικοποίησης όπου τα τεράστια αποθέματα SRAM τους λάμπουν.

Η εκτόξευση CS-4 επεκτείνει επίσης τη συνεργασία της Cerebras με το OpenAI. Η Yahoo Finance ανέφερε την αποκάλυψη μαζί με νέες συνεργασίες OpenAI και AMD που στοχεύουν στην επιτάχυνση της εξαγωγής συμπερασμάτων τεχνητής νοημοσύνης — με βάση τη λειτουργία Ultrafast που παρουσίασαν οι εταιρείες νωρίτερα τον Αύγουστο, η οποία έφερε το GPT-5.6 Sol στους χρήστες με έως και 750 tokens ανά δευτερόλεπτο.

Προειδοποιήσεις πίσω από τους αριθμούς επικεφαλίδων

Οι αναλυτές του κλάδου προτρέπουν να προσέχουμε τα στοιχεία μάρκετινγκ. Το Register σημειώνει ότι η επικεφαλίδα 250 petaFLOPS της Cerebras βασίζεται στην αραιότητα, η οποία γενικά δεν ωφελεί την εξαγωγή συμπερασμάτων μεγάλων γλωσσικών μοντέλων, και ότι τα μέγιστα στοιχεία εύρους ζώνης μνήμης είναι σε μεγάλο βαθμό θεωρητικά αφού το WSE-3 δεν είχε τον υπολογισμό για κορεσμό της δικής του SRAM. Η δημοσίευση αμφισβήτησε επίσης γιατί η Cerebras διπλασίασε την απόδοση αντί να αυξήσει τη χωρητικότητα SRAM, η οποία δεν έχει αυξηθεί σημαντικά από τότε που κυκλοφόρησε το WSE-2 πριν από πέντε χρόνια - μια περίεργη επιλογή σε μια εποχή αποσπασματικών συμπερασμάτων όπου οι επιταχυντές αποκωδικοποίησης επωφελούνται περισσότερο από τη μνήμη.

Ωστόσο, η ευκαιρία της αγοράς είναι πραγματική. Καθώς τα chatbots και οι πράκτορες τεχνητής νοημοσύνης απαιτούν ολοένα και ταχύτερους χρόνους απόκρισης, η ταχύτητα συμπερασμάτων έχει γίνει γνήσιος ανταγωνιστικός παράγοντας διαφοροποίησης και η Cerebras έχει πλέον αποδείξει ότι μπορεί να επαναλάβει την ασυνήθιστη τεχνολογία κλίμακας wafer σε εμπορικό ρυθμό.

Οι πρώτες αποστολές CS-4 ξεκινούν αυτό το τρίμηνο, με τα πρώτα συστήματα να αναμένονται online πριν από τα τέλη Σεπτεμβρίου. Το αν αυτό είναι αρκετό για να μειώσει την κυριαρχία της Nvidia μένει να φανεί — αλλά για πρώτη φορά εδώ και λίγο καιρό, το ταχύτερο συμπέρασμα AI στον κλάδο έχει νέα διεύθυνση.

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Οι εκτοξεύσεις υλικού, όπως το CS-4, μετακινούν τις αγορές και επαναπροσδιορίζουν τι μπορούν να κάνουν τα συστήματα τεχνητής νοημοσύνης. Διαβάστε περισσότερα νέα AI για να παρακολουθείτε κάθε εξέλιξη.

Εξερευνήστε την πιο πρόσφατη κάλυψη AI →