Η γερμανική εταιρεία τεχνητής νοημοσύνης Aleph Alpha κυκλοφόρησε το Kolibri, ένα ανοιχτό μοντέλο γλώσσας Mixture-of-Experts που δημιουργήθηκε από την αρχή για γερμανικά και αγγλικά. Το μοντέλο συσκευάζει 78,1 δισεκατομμύρια συνολικές παραμέτρους, αλλά ενεργοποιεί μόνο 3,46 δισεκατομμύρια από αυτές ανά κουπόνι - περίπου 4,4 τοις εκατό - και αποστέλλεται με την άδεια Apache 2.0 στο Hugging Face. Δέχεται έως και 1.048.576 διακριτικά περιβάλλοντος και επιτρέπει στους χρήστες να ορίζουν συλλογιστική προσπάθεια ανά αίτημα. Για τους αναγνώστες που παρακολουθούν το οικοσύστημα ανοιχτών βαρών, αυτό προσγειώνεται παράλληλα με τις [πιο πρόσφατες εξελίξεις AI] (https://aibuzzwire.news).
Η δημοσίευση είναι μια σκόπιμη δήλωση σχετικά με το πού βλέπει η Aleph Alpha την αγορά της: ανάπτυξη κυριαρχίας σε ρυθμιζόμενους τομείς όπως η δημόσια διοίκηση, η βιομηχανία και η αεροδιαστημική, όπου το να γνωρίζεις ακριβώς πού εκπαιδεύτηκε ένα μοντέλο, σε ποια δεδομένα και σε ποιο νομικό πλαίσιο δεν είναι ευχάριστο, αλλά απαίτηση προμήθειας.
Τι είναι στην πραγματικότητα ο Κολιμπρί
Το Kolibri, που αναφέρεται ως Kolibri-1 στα τεχνικά υλικά, είναι ένας δίγλωσσος μετασχηματιστής MoE Αγγλο-Γερμανίας που η Aleph Alpha λέει ότι αναπτύχθηκε από άκρη σε άκρη από ομάδες στη Γερμανία. Σύμφωνα με την έκθεση τεχνικής έρευνας της εταιρείας, η ομάδα έλεγχε τον πλήρη αγωγό - δεδομένα, αρχιτεκτονική, υποδομή εκπαίδευσης, μετεκπαίδευση και αξιολόγηση - αντί να ξεκινά από το σημείο ελέγχου ενός άλλου εργαστηρίου.
Η εκπαίδευση διεξήχθη σε υποδομές που βρίσκονται στη Γερμανία και τη Φινλανδία. Η διαδικασία σχεδιασμού στόχευε ρητά τη συμμόρφωση με τον Κώδικα Πρακτικής της ΕΕ για Τεχνητή Νοημοσύνη γενικού σκοπού, τον νόμο της ΕΕ για την τεχνητή νοημοσύνη και τον GDPR, και η Aleph Alpha έχει υπογράψει αυτόν τον Κώδικα. Η εταιρεία λέει ότι η γραμμή δεδομένων της διαγράφει προσωπικά δεδομένα πριν από την εκπαίδευση, μια λεπτομέρεια που απευθύνεται απευθείας σε αγοραστές του δημόσιου τομέα που δεν μπορούν να τροφοδοτήσουν νομικά δεδομένα πολιτών σε μοντέλα ασαφούς προέλευσης.
Λειτουργεί σε μία μόνο GPU
Η δυνατότητα ανάπτυξης ήταν ξεκάθαρα ένας περιορισμός σχεδιασμού, όχι μια εκ των υστέρων σκέψη. Το σημείο ελέγχου FP8 ζυγίζει περίπου 78 GB και εκτελείται σε μία μόνο NVIDIA B200, B300 ή H200 — ή σε δύο GPU H100 SXM5 — που εξυπηρετούνται μέσω vLLM με αποκλειστικό συλλογισμό Kolibri και αναλυτές κλήσης εργαλείων. Για ένα μοντέλο 78 δισεκατομμυρίων παραμέτρων, αυτό είναι ένα μέτριο αποτύπωμα υλικού και είναι η άμεση ανταμοιβή της αραιής σχεδίασης MoE: με ενεργές μόνο 3,46 δισεκατομμύρια παραμέτρους ανά διακριτικό, το κόστος συμπερασμάτων παρακολουθεί τον αριθμό των ενεργών παραμέτρων και όχι το σύνολο.
Αραιοί ειδικοί και υβριδική προσοχή
Κάτω από το καπό, το Kolibri στοιβάζει 50 μπλοκ μετασχηματιστών με πλάτος μοντέλου 2.560. Κάθε επίπεδο MoE βαθμολογεί και τους 384 δρομολογημένους ειδικούς με έναν σιγμοειδές δρομολογητή, στέλνει κάθε διακριτικό στους κορυφαίους 6 και εκτελεί πάντα 1 κοινό ειδικό μαζί τους. Το έμπειρο φορτίο εξισορροπείται χρησιμοποιώντας δύο τεχνικές με αλφαβητικά ονόματα — Exact Quantile Balancing και Load-Error Injection — που εμποδίζουν τον δρομολογητή να καταρρέει όλη την κίνηση σε μια χούφτα ειδικών.
Η προσοχή είναι όπου η αρχιτεκτονική γίνεται πιο ενδιαφέρουσα. Το Kolibri χρησιμοποιεί την προσοχή ομαδοποιημένου ερωτήματος με 48 κεφαλές ερωτήματος και κεφαλές 4 KV, αλλά τα επίπεδα δεν είναι ομοιόμορφα: κάθε πέμπτο μπλοκ χρησιμοποιεί πλήρη προσοχή χωρίς κωδικοποίηση θέσης, ενώ τα άλλα 40 μπλοκ χρησιμοποιούν προσοχή συρόμενου παραθύρου πάνω από τα 512 προηγούμενα διακριτικά, με RoPE. Η πρακτική συνέπεια είναι η αποδοτικότητα της μνήμης — τα επίπεδα συρόμενων παραθύρων διατηρούν μια κρυφή μνήμη σταθερού μεγέθους KV, επομένως μόνο 10 από τα 50 επίπεδα αναπτύσσονται με μήκος περιβάλλοντος. Στον αντίστοιχο υπολογισμό, το Aleph Alpha αναφέρει ότι ο υβριδικός σχεδιασμός υποστηρίζει ακολουθίες τέσσερις φορές μεγαλύτερες από ένα ισοδύναμο μοντέλο πλήρους προσοχής. Αυτός είναι ο τρόπος με τον οποίο ένα μοντέλο αυτού του μεγέθους διεκδικεί ένα παράθυρο περιβάλλοντος αξίας ενός εκατομμυρίου χωρίς εξωτική υποδομή.
Ένα tokenizer κατασκευασμένο για γερμανικά
Οι περισσότεροι κατασκευαστές συνόρων αντιμετωπίζουν τα γερμανικά ως εκ των υστέρων σκέψη, χωρίζοντας τις μεγάλες σύνθετες λέξεις του σε θραύσματα που διογκώνουν τον αριθμό των διακριτικών και το αποτελεσματικό κόστος. Η Aleph Alpha επιτέθηκε απευθείας σε αυτό με το UniBPE, ένα λεξιλόγιο 128.000 τόνων που δημιουργεί συγχωνεύσεις με τον τρόπο που κάνει το BPE, αλλά βαθμολογεί κάθε συγχώνευση με απώλεια Unigram.
Οι αριθμοί κάνουν την υπόθεση. Σε γερμανικό κείμενο, το tokenizer του Kolibri φτάνει τα 4,90 byte ανά διακριτικό, έναντι 4,35 για το tokenizer GPT-5 — δηλαδή 11,2 τοις εκατό λιγότερα διακριτικά στο γερμανικό κείμενο ιστού. Στα αγγλικά, το Kolibri βγαίνει επίσης μπροστά, στα 4,58 byte ανά διακριτικό έναντι του 4,67 του GPT-5. Για εταιρικούς πελάτες που πληρώνουν με διακριτικό, αυτή είναι μια άμεση έκπτωση σε κάθε φόρτο εργασίας στη γερμανική γλώσσα.
Εκπαιδεύτηκε σε συνοριακή κλίμακα
Η προπόνηση πίσω από το Kolibri είναι σημαντική. Η προ-εκπαίδευση κάλυψε 20 τρισεκατομμύρια μάρκες σε 768 GPU NVIDIA B200, ακολουθούμενα από 3,44 τρισεκατομμύρια μάρκες ενδιάμεσης εκπαίδευσης με μήκος ακολουθίας 65.536 διακριτικών. Στη συνέχεια, ο αγωγός πέρασε μέσα από εποπτευόμενα στάδια μάθησης λεπτομέρειας και ενίσχυσης για να παράγει το τελικό μοντέλο με δυνατότητα συλλογιστικής που ακολουθεί τις οδηγίες. Η εταιρεία δημοσίευσε μια έκθεση τεχνικής έρευνας που καλύπτει τη διαδικασία, ένα ασυνήθιστο επίπεδο γνωστοποίησης για ένα ευρωπαϊκό εργαστήριο και ένα που στοχεύει ξεκάθαρα στην οικοδόμηση εμπιστοσύνης με τους ελεγχόμενους πελάτες.
Τι σημαίνει για την προώθηση της τεχνητής νοημοσύνης στην Ευρώπη
Το Kolibri εισέρχεται σε μια αγορά όπου οι εκδόσεις ανοιχτού βάρους από αμερικανικά και κινεζικά εργαστήρια κυριαρχούν στη συζήτηση και όπου οι ευρωπαϊκές κυβερνήσεις έχουν γίνει όλο και πιο φωνές για την ψηφιακή κυριαρχία. Το στοίχημα του Aleph Alpha είναι ότι ένα κομμάτι αυτής της αγοράς —υπουργεία, βιομηχανία που γειτνιάζει με την άμυνα, κρίσιμες υποδομές— θα πληρώσει για ένα μοντέλο που δεν είναι απλώς ανοιχτό, αλλά επαληθεύσιμο ευρωπαϊκό όσον αφορά τον χειρισμό δεδομένων, την τοποθεσία εκπαίδευσης και τη νομική του στάση.
Το αν αυτό το στοίχημα αποδώσει εξαρτάται από ερωτήματα που δεν απαντά ακόμη η κυκλοφορία: πώς το Kolibri κάνει συγκριτική αξιολόγηση έναντι των ανοιχτών μοντέλων σε τυπικές αξιολογήσεις και πόσο γρήγορα σχηματίζεται ένα οικοσύστημα εργαλείων γύρω από αυτό. Αυτό που αποδεικνύεται από την έκδοση είναι ότι μια πλήρης στοίβας, γειτονικά στα σύνορα, υπάρχει πλέον εντός της ΕΕ, με τα χαρτιά να ταιριάζουν. Για οργανισμούς που δεσμεύονται από το GDPR και τον νόμο AI, αυτός ο συνδυασμός μπορεί να έχει μεγαλύτερη σημασία από τις θέσεις του leaderboard.
---
Μείνετε μπροστά από την τεχνητή νοημοσύνηΛάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →