Η ομάδα Ornith κυκλοφόρησε το Ornith-1.5, μια οικογένεια μοντέλων γλώσσας ανοιχτού βάρους που χτίστηκε γύρω από μια ασυνήθιστη ιδέα: το μοντέλο δημιουργεί τις δικές του εκπαιδευτικές εργασίες, σχεδιάζει τα δικά του ικριώματα και μαθαίνει από τις δικές του προσπάθειες λύσης σε έναν βρόχο συνεχούς λειτουργίας. Σύμφωνα με τις εκτιμήσεις της ίδιας της ομάδας, η ναυαρχίδα Ornith-1.5-397B βαθμολογείται με 86,1 στο Terminal-Bench 2.1 (Terminus-2), τοποθετώντας το στο ίδιο επίπεδο με το Claude Opus 4.8 της Anthropic στο 85.0 και μπροστά από κάθε άλλο μοντέλο ανοιχτού κώδικα συγκρίσιμου μεγέθους.
Η έκδοση, που δημοσιεύτηκε αυτή την εβδομάδα στο ιστολόγιο Ornith και στο Hugging Face με άδεια MIT, είναι η τελευταία διέξοδος στον αγώνα τεχνητής νοημοσύνης ανοιχτού κώδικα που παράγει τακτικά αποτελέσματα που κάποτε θεωρούνταν αδύνατα χωρίς τον προϋπολογισμό ενός συνοριακού εργαστηρίου. Για τους προγραμματιστές και τις επιχειρήσεις που παρακολουθούν τα [τελευταία νέα μοντέλα τεχνητής νοημοσύνης] (https://aibuzzwire.news), η σημασία είναι διπλή: η ισοτιμία αναφοράς με ένα κορυφαίο κλειστό μοντέλο και μια συνταγή εκπαίδευσης που δείχνει προς τα πού οδεύει η ανάπτυξη ανοιχτών μοντέλων.
Τρία μεγέθη, μία συνταγή
Το Ornith-1.5 αποστέλλεται σε τρεις διαμορφώσεις: μια ναυαρχίδα 397B παραμέτρων μείγματος ειδικών, ένα 35B MoE που ενεργοποιεί μόνο 3B παραμέτρους ανά διακριτικό και ένα συμπαγές μοντέλο πυκνότητας 9B με μια κβαντισμένη παραλλαγή "Mobile" σχεδιασμένη να λειτουργεί απευθείας σε συσκευές iPhone και Android. Και οι τρεις είναι διαθέσιμες στο Hugging Face μαζί με τις εκδόσεις GGUF, MLX και NVFP4 και οι κάρτες μοντέλων υποδεικνύουν ότι η οικογένεια είναι χτισμένη στην αρχιτεκτονική Qwen3.5 MoE.
Η καταγωγή έχει σημασία εδώ. Το Ornith-1.0, που κυκλοφόρησε νωρίτερα αυτό το έτος, έκανε δημοφιλή την προσέγγιση "self-scaffolding" στην agent coding και έγινε μια ήσυχη επιτυχία — η έκδοση 9B GGUF έχει καταγράψει περισσότερες από πέντε εκατομμύρια λήψεις στο Hugging Face. Το Ornith-1.5 επεκτείνει αυτό το πλαίσιο από τη βελτιστοποίηση των ικριωμάτων και των αναπτύξεων σε έναν αγωγό πλήρους αυτοβελτίωσης.
Ο βρόχος αυτοβελτίωσης, επεξήγηση
Σε έναν συμβατικό αγωγό μετά την εκπαίδευση, η ενισχυτική μάθηση έρχεται σε αντίθεση με ένα σταθερό σύνολο εργασιών που επιμελούνται από τον άνθρωπο. Αντίθετα, το Ornith-1.5 βάζει το ίδιο το μοντέλο να προτείνει νέες εργασίες, να δημιουργεί ένα ικρίωμα για συγκεκριμένη εργασία - τις οδηγίες, τα εργαλεία και τη στρατηγική αποσύνθεσης που χρησιμοποιούνται για την επίθεση στο πρόβλημα - και στη συνέχεια να παράγει λύσεις που βαθμολογούνται από το ικρίωμα που μόλις κατασκεύασε. Η ανταμοιβή διαδίδεται και στα τρία στάδια χρησιμοποιώντας το GRPO, έτσι το σύστημα μαθαίνει ταυτόχρονα να γράφει καλύτερες εργασίες, καλύτερα ικριώματα και καλύτερες λύσεις.
Η ανταμοιβή δημιουργίας εργασιών είναι η καρδιά του σχεδιασμού. Κάθε προτεινόμενη εργασία βαθμολογείται σε τρία πολλαπλασιαστικά σήματα: εγκυρότητα (το ικρίωμα εκτελείται και αξιολογείται σωστά;), οριακή δυσκολία (είναι το εμπειρικό ποσοστό επιτυχίας του μοντέλου κοντά σε έναν στόχο περίπου 20%, διατήρηση των εργασιών δύσκολες αλλά εκμαθήσιμες;) και καινοτομία (είναι αρκετά διαφορετικό από όλα σε ένα buffer εργασιών που δημιουργήθηκαν προηγουμένως;). Επειδή η δυσκολία μετριέται με το τρέχον ποσοστό επιτυχίας του ίδιου του μοντέλου, το πρόγραμμα σπουδών κλιμακώνεται αυτόματα καθώς το μοντέλο βελτιώνεται.
Η ομάδα αναφέρει επίσης ρητά μέτρα κατά της πειρατείας κατά την αξιολόγηση: το ιστορικό git αφαιρείται από τις εικόνες του αποθετηρίου, ώστε τα μοντέλα να μην μπορούν να ανακτήσουν προηγούμενες λύσεις και η πρόσβαση στο δίκτυο είναι απενεργοποιημένη για να αποτρέψει τα μοντέλα από τη λήψη εξωτερικών απαντήσεων. Όλα τα αποτελέσματα υπολογίζονται κατά μέσο όρο σε πέντε ανεξάρτητες διαδρομές.
Οι αριθμοί
Στην κωδικοποίηση agent, τα αυτοαναφερόμενα αποτελέσματα της ναυαρχίδας συγκεντρώνονται στην κορυφή του πεδίου ανοιχτού κώδικα. Στο Terminal-Bench 2.1 περνούν από την πλεξούδα Terminus-2, το Ornith-1.5-397B 86.1 ξεπερνά τα Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) και GLM-5.2 (81). Στο ίδιο σημείο αναφοράς που περνά μέσα από την πλεξούδα Claude Code, το Ornith-1.5 τοποθετεί το 85.2 έναντι του 78.9 του Opus 4.8. Στο SWE-bench Verified, οι δύο είναι ουσιαστικά ισόπαλοι στο 86,0 και 85,8, με την Kimi K3 ελαφρώς μπροστά στο 86,2.
Τα κενά διευρύνονται σε πιο σκληρές σουίτες με πρακτορεία. Στο DeepSWE, το Ornith-1.5-397B σκοράρει 56.0 — μπροστά από το 46.2 του GLM-5.2, αν και πίσω από το Opus 4.8 (59.0) και το Kimi K3 (67.5). Το πιο εντυπωσιακό άλμα είναι γενεαλογικό: το Ornith-1.0 σημείωσε μόλις 8,0 στο DeepSWE, που σημαίνει ότι η νέα επανάληψη προσφέρει επταπλάσια βελτίωση στην ίδια οικογένεια σημείων αναφοράς.
Τα μικρότερα μοντέλα λένε τη δική τους ιστορία. Το Ornith-1.5-35B-A3B, ενεργοποιώντας μόνο 3Β παραμέτρους ανά διακριτικό, βαθμολογείται με 68,5 στο Terminal-Bench 2.1 (Κωδικός Claude) έναντι 43,4 για το Gemma 4-31B της Google και 51,7 για το Muse Glimmer της Meta και το Postsified. Το μοντέλο 9B φτάνει το 47,0 στο Terminal-Bench 2.1, το 70,6 στο SWE-bench Verified και το 86,4 στο GPQA Diamond — αριθμοί που βάζουν ένα μοντέλο της κατηγορίας τηλεφώνου σε εντυπωσιακή απόσταση από τους ανταγωνιστές της κατηγορίας desktop.
Προειδοποιήσεις και πλαίσιο
Αυτά είναι σημεία αναφοράς που εκτελούνται από προγραμματιστές, όχι αποτελέσματα ανεξάρτητου ελέγχου και τα μοντέλα σύγκρισης αξιολογήθηκαν από την ομάδα Ornith με τις δικές της ρυθμίσεις πλεξούδας. Τα ανταγωνιστικά εργαστήρια συντονίζονται επίσης για διαφορετικούς συμβιβασμούς. Το προβάδισμα του Kimi K3 στο DeepSWE υποδηλώνει ότι τα όρια της εργασίας πρακτορείου λογισμικού εξακολουθεί να αμφισβητείται. Αλλά η διαφάνεια του πλήρους πίνακα της έκδοσης - μέσοι όροι πέντε εκτελέσεων, δημοσιευμένες διαμορφώσεις πλεξούδας, αποκαλυπτόμενες διασφαλίσεις - καθιστά την ανεξάρτητη αναπαραγωγή ασυνήθιστα απλή.
Η ανταπόκριση της κοινότητας ήταν ουσιαστική. Η ανακοίνωση κυκλοφορίας συγκέντρωσε πάνω από εκατό σημεία στο Hacker News μέσα σε λίγες ώρες, με τη συζήτηση να επικεντρώνεται λιγότερο στους ισχυρισμούς αναφοράς παρά στη μεθοδολογία αυτοβελτίωσης, την οποία αρκετοί σχολιαστές περιέγραψαν ως μία από τις πιο αξιόπιστες ανοιχτές υλοποιήσεις δημιουργίας εργασιών αναδρομικού τύπου.
Για το οικοσύστημα ανοιχτού κώδικα, το Ornith-1.5 προσγειώνεται σε μια στιγμή που ανοιχτά μοντέλα από τα εργαστήρια της Κίνας και τις δυτικές ανεξάρτητες ομάδες κλείνουν το χάσμα με τα κλειστά σύνορα στις εργασίες κωδικοποίησης και αντιπροσώπων. Μια οικογένεια με άδεια MIT που ταιριάζει με ένα κορυφαίο κλειστό μοντέλο στο Terminal-Bench — και αποστέλλει μια παραλλαγή 9Β με δυνατότητα τηλεφώνου — μειώνει περαιτέρω αυτό το χάσμα και το κάνει με μια μέθοδο εκπαίδευσης που ο καθένας μπορεί να επιθεωρήσει, να αναπαράγει και να επεκτείνει.
---
Μείνετε μπροστά από την τεχνητή νοημοσύνηΛάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →