Ένα ελάχιστα γνωστό έργο ανοιχτού κώδικα που ονομάζεται Strata έχει μια στιγμή. Ο κινητήρας με άδεια MIT, ο οποίος τρέχει το Qwen3.8-Flash-Next της Alibaba — ένα μοντέλο μείγματος ειδικών 125 δισεκατομμυρίων παραμέτρων — σε συνηθισμένους υπολογιστές παιχνιδιών, κυκλοφόρησε στην πρώτη σελίδα του Hacker News στις 4 Οκτωβρίου με περισσότερους από 640 πόντους και το αποθετήριο GitHub έχει συλλέξει από 4 Σεπτεμβρίου 2000 και πάνω.
Το βήμα είναι απλό: ένα μοντέλο 125 δισεκατομμυρίων παραμέτρων που ζει κανονικά σε έναν διακομιστή μπορεί να συνομιλεί, να γράφει κώδικα, να διαβάζει εικόνες και να οδηγεί τους πράκτορες κωδικοποίησης εξ ολοκλήρου σε μια κάρτα γραφικών καταναλωτή, χωρίς να φεύγει τίποτα από το μηχάνημα.
Τι κάνει στην πραγματικότητα η Strata
Το Strata είναι ταυτόχρονα μια μηχανή συμπερασμάτων και ένα πρόγραμμα εγκατάστασης με ένα κλικ για Windows και Linux. Σύμφωνα με την τεκμηρίωσή της, οι απαιτήσεις είναι μέτριες για τα πρότυπα του προηγμένου μοντέλου: μια GPU με τουλάχιστον 12 GB VRAM από τις σειρές RTX 20, 30, 40 ή 50 της NVIDIA ή τις σειρές Radeon RX 6000, 7000 ή 9000 της AMD, τουλάχιστον 32 GB χώρο RAM.
Ο κινητήρας αποστέλλει κβαντισμένες εκδόσεις του Qwen3.8-Flash-Next σε διάφορα επίπεδα συμπίεσης, από Q2_0 έως IQ3_S, καθώς και μια παραλλαγή που εξειδικεύεται στον κώδικα. Εκθέτει OpenAI και API συμβατά με Anthropic στον localhost, πράγμα που σημαίνει ότι τα εργαλεία που έχουν δημιουργηθεί για ChatGPT ή Claude — συμπεριλαμβανομένων των πρακτόρων κωδικοποίησης όπως ο Claude Code, ο Cursor και ο Codex — μπορούν να κατευθύνονται στον τοπικό διακομιστή με ελάχιστες αλλαγές. Περιλαμβάνονται προαιρετική είσοδος εικόνας και υποστήριξη πολλαπλών GPU, ενώ το πρόγραμμα εγκατάστασης προσφέρει ακόμη και μια λειτουργία ρύθμισης με τη βοήθεια AI που επιτρέπει σε έναν βοηθό κωδικοποίησης να διαμορφώσει το μηχάνημα από ένα μόνο επικολλημένο μήνυμα.
Οι αριθμοί ταχύτητας
Τα δημοσιευμένα σημεία αναφοράς του έργου, τα οποία μετρήθηκαν σε δύο επιτραπέζιους υπολογιστές καταναλωτών, είναι ο λόγος για την εξάπλωση της κυκλοφορίας. Σε μια NVIDIA RTX 5070 με 12 GB VRAM σε συνδυασμό με Ryzen 5 7600 και 64 GB RAM, η Strata αναφέρει:
- Q2_0 quantization: 94 tokens ανά δευτερόλεπτο για παραγωγή και 2.650 tokens ανά δευτερόλεπτο για άμεση επεξεργασία σε ένα έγγραφο 32K-token
- IQ3_S: 53 tokens ανά δεύτερη γενιά, 1.620 tokens ανά δευτερόλεπτο επεξεργασία προτροπής
- Παραλλαγή κωδικοποιητή: 55 μάρκες ανά δεύτερη γενιά
Από την πλευρά της AMD, ένα RX 9070 XT με 16 GB VRAM διαχειριζόταν 60 tokens ανά δευτερόλεπτο στο Q2_0. Η τεκμηρίωση εκτιμά ότι ένα RTX 3090 με 24 GB VRAM θα πρέπει να φτάνει τα 100 έως 140 tokens ανά δευτερόλεπτο — πιο γρήγορα από ό,τι οι περισσότεροι άνθρωποι μπορούν να διαβάσουν.
Για σύγκριση, πριν από έξι μήνες, η εκτέλεση ακόμη και ενός μοντέλου πυκνότητας 70 δισεκατομμυρίων παραμέτρων τοπικά σε χρησιμοποιήσιμες ταχύτητες απαιτούσε έναν σταθμό εργασίας με εκατοντάδες gigabyte ενοποιημένης μνήμης ή επιθετικά κερδοσκοπικά κόλπα αποκωδικοποίησης.
Γιατί ένα μοντέλο 125B ταιριάζει σε μια κάρτα παιχνιδιού
Δύο κομμάτια τεχνολογίας το καθιστούν δυνατό. Το πρώτο είναι το ίδιο το μοντέλο. Όπως κάλυπτε το AI Buzz Wire στην κυκλοφορία του, το Qwen3.8-Flash-Next είναι μια αρχιτεκτονική μείγματος ειδικών με περίπου 125 δισεκατομμύρια συνολικές παραμέτρους αλλά μόνο περίπου 6 δισεκατομμύρια ενεργές ανά διακριτικό — έτσι κάθε λέξη που δημιουργείται αγγίζει ένα μικρό τμήμα του δικτύου, περιορίζοντας δραματικά τον υπολογισμό ανά διακριτικό.
Το δεύτερο είναι η κβαντοποίηση. Οι ταχύτερες προεπιλογές της Strata συμπιέζουν τα βάρη του μοντέλου σε δύο ή τρία bit ανά παράμετρο, ανταλλάσσοντας κάποια ακρίβεια για ένα αποτύπωμα που ταιριάζει σε μια GPU 12 GB και τη μνήμη RAM συστήματος. Αυτή η αντιστάθμιση είναι η κύρια προειδοποίηση: τα ποσά της κατηγορίας Q2 και της κατηγορίας IQ2 υποβαθμίζουν μετρήσιμα την ποιότητα σε εργασίες με βαρύ συλλογισμό και οι αγοραστές θα πρέπει να αντιμετωπίζουν τους αριθμούς ταχύτητας τίτλου ως σημείο εκκίνησης και όχι ως εγγύηση για κάθε φόρτο εργασίας. Οι σελίδες συγκριτικής αξιολόγησης κοινότητας στο αποθετήριο παρακολουθούν αποτελέσματα ποιότητας σε διάφορα μεγέθη.
Μέρος ενός μεγαλύτερου κύματος τοπικής τεχνητής νοημοσύνης
Το Strata φτάνει εν μέσω επιταχυνόμενης ορμής για τοπικά συμπεράσματα. Η οικογένεια Qwen της Alibaba έχει γίνει η σειρά μοντέλων ανοιχτού βάρους με τις περισσότερες λήψεις, η Meta και η Google έχουν ανταγωνιστικά μοντέλα ανοιχτού κώδικα δικά τους και ένα κύμα εργαλείων επιτρέπει πλέον στους καταναλωτές να τρέχουν ικανούς βοηθούς χωρίς συνδρομές ή δεδομένα να φεύγουν από τις συσκευές τους.
Το έργο αντικατοπτρίζει επίσης τον τρόπο με τον οποίο μεταβάλλεται ο ορισμός του "καταναλωτικού υλικού". Μια κάρτα γραφικών μεσαίας κατηγορίας 2026 με 12 GB VRAM, η οποία αποστέλλεται κυρίως για παιχνίδια, είναι τώρα ένας βιώσιμος επιταχυντής συμπερασμάτων για ένα μοντέλο στην κατηγορία μεγέθους που καθόρισε τα συνοριακά συστήματα μόλις πριν από δύο χρόνια.
Το Strata παραμένει πρώιμο λογισμικό - ο εντοπισμός προβλημάτων του αποθετηρίου τεκμηριώνει τις αδρές άκρες σε παλαιότερες GPU και επεξεργαστές εκτός AVX2 - αλλά το έργο είναι με άδεια MIT, δωρεάν και αναπτύχθηκε ανοιχτά, με πειραματική υποστήριξη για Intel Arc, παλαιότερες κάρτες Tesla και Radeon και συσκευές πολλαπλών GPU τεκμηριωμένες από μέλη της κοινότητας.
Για τους προγραμματιστές, η πιο πρακτική λύση μπορεί να είναι η συμβατότητα API localhost: οποιοδήποτε σενάριο ή πράκτορας που έχει γραφτεί ενάντια στο OpenAI ή το Anthropic SDK μπορεί να ανακατευθυνθεί σε μια τοπική ανάπτυξη Qwen αλλάζοντας μια βασική διεύθυνση URL, καθιστώντας το Strata μια επιλογή χαμηλής τριβής για πρωτότυπα ευαίσθητα στο απόρρητο, χρήση εκτός σύνδεσης ή απλώς περιορισμό των δαπανών API.
Πώς να το δοκιμάσετε
Για να ξεκινήσετε δεν απαιτείται συνεδρία τερματικού με εγχειρίδιο. Το πρόγραμμα εγκατάστασης παρέχει προγράμματα οδήγησης, βάρη μοντέλων και τον τοπικό διακομιστή με ένα πέρασμα, και το αποθετήριο περιλαμβάνει ένα αρχείο εγκατάστασης που έχει σχεδιαστεί για να επικολλάται απευθείας σε έναν βοηθό κωδικοποίησης AI, ο οποίος στη συνέχεια διαμορφώνει αυτόνομα το μηχάνημα. Οι πρώτες εκκινήσεις είναι πιο αργές ενώ τα βάρη φορτώνονται από το δίσκο. η τεκμηρίωση προτείνει έναν SSD και προειδοποιεί ότι οι μακροχρόνιες συνομιλίες μετατοπίζουν περισσότερη δουλειά στη μνήμη RAM του συστήματος.
Μείνετε μπροστά από την τεχνητή νοημοσύνηΑκολουθήστε το AI Buzz Wire για τα πιο πρόσφατα μοντέλα ανοιχτού κώδικα, τοπικά εργαλεία AI και υλικό συμπερασμάτων.
Διαβάστε περισσότερα νέα AI →