Ένα μικρό αλλά εντυπωσιακό έργο κυκλοφορεί στο Hacker News αυτήν την εβδομάδα: το openTPU, ένας επιταχυντής τεχνητής νοημοσύνης ανοιχτού κώδικα του οποίου ο σχεδιασμός υλικού δημιουργήθηκε από πράκτορες AI. Το αποθετήριο, που δημοσιεύεται με την άδεια Apache 2.0 στο GitHub, περιγράφει αυτό που οι συγγραφείς του αποκαλούν «έναν επιταχυντή AI ανοιχτού κώδικα, που αναπτύχθηκε από την AI» — και σε αντίθεση με τα περισσότερα demo αυτού του είδους, εκτελεί πραγματικά μοντέλα παραγωγής με τα πραγματικά τους βάρη σε μια φυσική κάρτα που οι λάτρεις μπορούν να μελετήσουν από άκρη σε άκρη.
Το έργο θέτει δύο ερωτήματα, σύμφωνα με τα λόγια του δικού του README: πόσο μακριά μπορούν να φτάσουν οι πράκτορες τεχνητής νοημοσύνης στο σχεδιασμό υλικού και μπορούν να δημιουργήσουν το τσιπ που βγάζει τα δικά τους συμπεράσματα; Το δεύτερο ερώτημα είναι το προκλητικό. Ένα σύστημα τεχνητής νοημοσύνης που σχεδιάζει το πυρίτιο - ή σε αυτήν την περίπτωση, το bitstream FPGA - που δημιουργεί τα δικά του διακριτικά είναι ένας βρόχος που καταγράφει ακριβώς πού κατευθύνεται η φαντασία της βιομηχανίας. For more context on this story, see our ongoing AI news.
Τι τρέχει πραγματικά στην κάρτα
Ο στόχος υλικού είναι απίθανος για τα πρότυπα του κέντρου δεδομένων: μια κάρτα Inspur YPCB-00338 που βασίζεται σε ένα Xilinx Kintex-7 xc7k480t FPGA με δύο κανάλια DDR3 και εύρος ζώνης μέγιστης μνήμης 17,1 GB/s. Αυτό απέχει πολύ από έναν επιταχυντή με στοίβα HBM, που κάνει τα αποτελέσματα πιο ενδιαφέροντα, όχι λιγότερο.
Σύμφωνα με τις δημοσιευμένες μετρήσεις του έργου, ο σχεδιασμός τρέχει δέκα μοντέρνα ανοιχτά μοντέλα με τα πραγματικά τους βάρη. Το LFM2.5-230M αποκωδικοποιεί με 59 tokens ανά δευτερόλεπτο στο int8 και 85,8 tokens ανά δευτερόλεπτο σε 4-bit. Το Qwen3-0.6B διαχειρίζεται 21,6 tokens ανά δευτερόλεπτο, ενώ τα μεγαλύτερα μοντέλα μειώνονται όπως αναμενόταν: SmolLM3-3B στα 5 tokens ανά δευτερόλεπτο int8, Phi-4-mini (3,8B) στα 4 και Qwen3,5-4B σε 5,9 tokens ανά δευτερόλεπτο σε 4-bit. Τα Gemma 4 E2B και E4B τρέχουν επίσης, διατηρώντας τα τραπέζια ενσωμάτωσης ανά επίπεδο στην κάρτα.
Η ομάδα προχώρησε παραπέρα με μοντέλα με μείγμα ειδικών που ξεπερνούν τα 4 GiB DRAM της κάρτας. LFM2.5-8B-A1B — 8,5 δισεκατομμύρια παράμετροι με 1,7 δισεκατομμύρια ενεργές — αποκωδικοποιείται με 10,6 μάρκες ανά δευτερόλεπτο από ειδικούς ροής από τον χώρο αποθήκευσης κεντρικού υπολογιστή, με το 98,5 τοις εκατό των ειδικών χρήσεων να χτυπούν τις υποδοχές στην κάρτα και να μεταφέρονται μόνο 5,2 MB ανά διακριτικό. Το Qwen3.5-35B-A3B εκτελείται με 3,95 μάρκες ανά δευτερόλεπτο, ενώ ροή 153 MB ανά διακριτικό μέσω PCIe. Κάθε διαμόρφωση, δηλώνει το README, ταιριάζει με το διακριτικό προσομοιωτή του έργου για διακριτικό — ένας ισχυρισμός λίγο ακριβείας που οι χάκερ υλικού θα αναγνωρίσουν ως το δύσκολο μέρος της εργασίας.
Κατασκευάστηκε σαν ένα πραγματικό έργο πυριτίου
Αυτό που διαχωρίζει το openTPU από τα τυπικά χόμπι επιδείξεις FPGA είναι η πληρότητα της στοίβας. Το monorepo περιέχει τη σχεδίαση υλικού SystemVerilog, ένα προσαρμοσμένο σύνολο εντολών, έναν προσομοιωτή ακριβείας bit, μια γλώσσα πυρήνα με τον δικό του μεταγλωττιστή και το λογισμικό υποδοχής που οδηγεί την κάρτα PCIe, συμπεριλαμβανομένου ενός βοηθητικού προγράμματος παρακολούθησης otpu-smi στο πνεύμα της nvidia-smi και μιας επίδειξης otpu-chat.
Η εικόνα παραγωγής εκτελεί μια μονάδα συστολικής μήτρας τεσσάρων στηλών και μια μηχανή ροής στα 133,33 MHz, με ελεγκτές μνήμης LiteDRAM βαθμονομημένους από μια μικρή CPU μέσα στον πυρήνα της μνήμης — η κάρτα βαθμονομεί και τα δύο κανάλια DDR3 σε 12 δευτερόλεπτα χωρίς συμμετοχή κεντρικού υπολογιστή. Η τρέχουσα έκδοση, που έχει αναπτυχθεί από την 1η Οκτωβρίου, αποκωδικοποιεί αρκετά μοντέλα 8 έως 10 τοις εκατό γρηγορότερα από την προηγούμενη εικόνα, ενώ ωθεί τη χρήση DRAM στο 91-94 τοις εκατό της αιχμής.
Το έργο τεκμηριώνει επίσης μια μορφή βάρους 4 bit βασισμένη σε τιμές FP4 με κλίμακες μπλοκ δύο επιπέδων στα 4,25 bit ανά βάρος, διατηρώντας την κεφαλή του μοντέλου γλώσσας στο int8 για ακρίβεια. Η μορφή μειώνει τα byte ανά διακριτικό κατά περίπου το ένα τρίτο και αυξάνει την ταχύτητα αποκωδικοποίησης κατά 40 έως 45 τοις εκατό σε ορισμένα μοντέλα.
Το README πιστώνει την προσέγγιση του έργου στα μαθήματα από ένα παλαιότερο αποθετήριο, το auto-arch-tournament, το οποίο διερεύνησε την αναζήτηση αρχιτεκτονικής υλικού με γνώμονα την τεχνητή νοημοσύνη. Το openTPU είναι η εφαρμογή αυτής της μεθόδου σε έναν πλήρη επιταχυντή, με τον σχεδιασμό των πρακτόρων να επικυρώνεται έναντι ενός προσομοιωτή πριν αγγίξει ποτέ το υλικό.
Γιατί έχει σημασία
Η απόδοση εδώ δεν θα προβληματίσει τη Nvidia. Ένα Kintex-7 με DDR3 είναι μια κατηγορία υλικού δεκαετιών και τα μοντέλα που τρέχει είναι μικρά. Αλλά αυτό είναι το σημείο που κάνει έμμεσα το έργο: ολόκληρος ο επιταχυντής - RTL, σύνολο εντολών, προσομοιωτής, μεταγλωττιστής και στοίβα κεντρικού υπολογιστή - είναι ευανάγνωστος σε ένα άτομο, σε ένα αποθετήριο, και σχεδιάστηκε τουλάχιστον εν μέρει από πράκτορες AI και όχι από ομάδα υλικού.
Τρία ρεύματα συγκλίνουν σε αυτή την ιδέα. Πρώτον, το υλικό τεχνητής νοημοσύνης ανοιχτού κώδικα έχει εδώ και καιρό εμποδίζεται από το τεράστιο εύρος της απαιτούμενης τεχνογνωσίας. μια ροή σχεδίασης που βασίζεται σε πράκτορες μειώνει αυτό το εμπόδιο. Δεύτερον, η ζήτηση συμπερασμάτων ωθεί τους ερευνητές προς το εξωτικό υλικό ειδικού σκοπού και η αυτοματοποιημένη αναζήτηση σχεδίου είναι μια φυσική εφαρμογή για την εξερεύνηση αυτού του χώρου. Τρίτον, η γωνία αυτο-φιλοξενίας - η τεχνητή νοημοσύνη που κατασκευάζει το μηχάνημα με το οποίο λειτουργεί - έχει γίνει ένα σήμα που η κοινότητα παρακολουθεί στενά, κρίνοντας από την ταχεία άνοδο του έργου στο Hacker News, όπου συγκέντρωσε περισσότερους από 150 πόντους μέσα σε λίγες ώρες.
Το αποθετήριο δημιουργήθηκε στις 24 Σεπτεμβρίου και έλαβε την τελευταία του ώθηση στις 2 Οκτωβρίου, με τα μετρημένα αποτελέσματα να χρονολογούνται μόλις την 1η Οκτωβρίου — ένας ρυθμός ανάπτυξης που αξίζει να παρακολουθήσετε από μόνος του. Για όποιον θέλει να καταλάβει πώς λειτουργεί ένας επιταχυντής τεχνητής νοημοσύνης από έναν πολλαπλασιασμό μήτρας στην Python μέχρι τα καλώδια, το ίδιο το πλαίσιο του έργου είναι ακριβές: το όλο πράγμα ζει σε ένα μικρό μονορέπο που μπορείτε να διαβάσετε από άκρη σε άκρη.
Είτε το υλικό που έχει σχεδιαστεί από πράκτορες γίνεται μια σοβαρή θέση είτε παραμένει ερευνητική περιέργεια, το openTPU έχει αποδείξει κάτι συγκεκριμένο: τα εργαλεία που επιτρέπουν στα μοντέλα AI να γράφουν λογισμικό έχουν πλέον δημιουργήσει ένα λειτουργικό, επαληθευμένο σύστημα υλικού που τρέχει τα ίδια μοντέλα. Ο βρόχος είναι κλειστός, τουλάχιστον στην κλίμακα FPGA.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →