Η Cognition, η εταιρεία πίσω από τον μηχανικό λογισμικού Devin AI, κυκλοφόρησε το SWE-2 την Πέμπτη, περιγράφοντάς το ως το πιο προηγμένο μοντέλο κωδικοποίησης μέχρι σήμερα. Σε μια ανάρτηση ιστολογίου που δημοσιεύθηκε στις 10 Σεπτεμβρίου, η εταιρεία είπε ότι το νέο μοντέλο προωθεί αυτό που αποκαλεί Pareto σύνορα ικανότητας και κόστους, σημειώνοντας 50,0% στο βασικό σημείο αναφοράς FrontierCode 1.1 ενώ κοστίζει 64% λιγότερο από το Fable 5.1, το μοντέλο Anthropic που βρίσκεται μόλις ένα πόντο μπροστά από αυτό στο 50,9%.
Η κυκλοφορία γίνεται μόλις μια μέρα αφότου η Cognition επιβεβαίωσε έναν γύρο χρηματοδότησης 2 δισεκατομμυρίων δολαρίων σε αποτίμηση 48 δισεκατομμυρίων δολαρίων και σηματοδοτεί πόσο επιθετικά επενδύει η startup πρακτόρων κωδικοποίησης στην ανάπτυξη του δικού της μοντέλου αντί να βασίζεται αποκλειστικά σε μοντέλα συνόρων τρίτων. Για συνεχή κάλυψη του αγώνα κωδικοποίησης AI και οτιδήποτε άλλο συγκινεί τη βιομηχανία, προσθέστε σελιδοδείκτη AI Buzz Wire, την καθημερινή σας πηγή για έκτακτες ειδήσεις AI.
Όπου το SWE-2 προσγειώνεται στα σημεία αναφοράς
Σύμφωνα με τα δημοσιευμένα αποτελέσματα της Cognition, το SWE-2 έχει 50,0% στο FrontierCode 1.1 Main, μπροστά από το Grok 4,6 στο 48,0% και το GPT-5,6 Sol στο 47,5% και σε απόσταση αναπνοής από το GPT-6 Astra, το οποίο οδηγεί στο πεδίο με 53,3%. Στο σημείο αναφοράς DeepSWE 1.1, το SWE-2 φτάνει το 73,0%, δεύτερο μόνο μετά το 74,1% του Astra στις λίστες Cognition μοντέλων.
Η ισχυρότερη εμφάνιση έρχεται στο Terminal-Bench 2.1, όπου το SWE-2 σημειώνει 92,8%, το υψηλότερο ποσοστό στον συγκριτικό πίνακα του Cognition και μπροστά από το Fable 5.1 με 91,4% και το GPT-6 Astra με 89,9%. Η εικόνα αλλάζει στο πιο σκληρό Terminal-Bench 4, όπου το SWE-2 καταφέρνει το 27,3% έναντι 57,9% για το GPT-6 Astra και 55,8% για το Fable 5.1, μια υπενθύμιση ότι η σχεδίαση του μοντέλου στην αρχή της απόδοσης αφήνει ελεύθερο χώρο στην κορυφή της δυσκολίας εργασίας.
Το Cognition συνοψίζει ωμά την τοποθέτηση: στο FrontierCode 1.1 Main και στο DeepSWE 1.1, το SWE-2 ξεπερνά το προηγούμενο μοντέλο του SWE-1.7 και το Grok 4.6 τόσο σε βαθμολογία όσο και σε κόστος, ταιριάζει με το GPT-5.6 Sol και το Fable 5/5.1 σε ένα κλάσμα της τιμής του GPT σε ένα τέταρτο της τιμής τους.
Μετα-εκπαίδευση από την Kimi K3 σε κλίμακα πολλαπλών τρισεκατομμυρίων
Το SWE-2 δεν έχει κατασκευαστεί από την αρχή. Η Cognition εκπαίδευσε το μοντέλο από το Kimi K3, ένα βασικό μοντέλο 2,8 τρισεκατομμυρίων παραμέτρων από το Moonshot AI που είχε ήδη υποβληθεί σε εκτεταμένη ενισχυτική εκμάθηση για την κωδικοποίηση πράκτορα. Πέρα από αυτό το θεμέλιο, η Cognition λέει ότι η διαδικασία RL πρόσθεσε πέντε έως έξι σημεία σε πολλά σημεία αναφοράς και άλλαξε ολόκληρο το όριο κόστους-απόδοσης του K3.
Η εταιρεία λέει ότι το SWE-2 είναι η πρώτη φορά που κλιμακώνει την ενισχυτική μάθηση στο καθεστώς πολλών τρισεκατομμυρίων παραμέτρων, βασιζόμενη στην εκπαιδευτική υποδομή και τη συνταγή που αναπτύχθηκε για το SWE-1.7. Η βασική προσθήκη είναι ένας αλγόριθμος RL που εκπαιδεύει όλα τα επίπεδα συλλογιστικής-προσπάθειας σε ένα μόνο τρέξιμο, αντί να αντιμετωπίζει τη χαμηλή, μεσαία και υψηλή προσπάθεια ως ξεχωριστούς στόχους εκπαίδευσης.
Ποινές κόστους διαμορφώνουν ολόκληρο το σύνορο
Μια κεντρική ιδέα στην εκπαίδευση του SWE-2 είναι μια γραμμική ποινή κόστους που εφαρμόζεται ανά επίπεδο προσπάθειας σε μία μόνο διαδρομή RL, με κάθε ποινή συντονισμένη στην τοπική κλίση των συνόρων Pareto του βασικού μοντέλου. Η Cognition λέει ότι αυτή η προσέγγιση, που προέρχεται από τις πρώτες αρχές, προάγει ολόκληρο το όριο κόστους-απόδοσης του μοντέλου, ενώ διατηρεί το σχήμα του και αντικατοπτρίζει το πραγματικό κόστος χρήστη όσο το δυνατόν πιο άμεσα στην εκπαίδευση.
Η εταιρεία παρουσίασε επίσης μια βασική γραμμή ανταμοιβής που έχει χρησιμοποιήσει από το SWE-1.6, την οποία πιστώνει με σημαντικά σταθεροποιητική εκπαίδευση, παράλληλα με βελτιώσεις στην υπηρεσία διάθεσης RL που περιλαμβάνουν ένα διαδικτυακό μοντέλο πρόχειρου για αύξηση της απόδοσης αποκωδικοποίησης. Με πυρήνες NVFP4 και FP8 και εκπαίδευση με επίγνωση κβαντισμού, η Cognition λέει ότι μείωσε τη συνολική χρήση μνήμης παρόλο που το βασικό μοντέλο είχε σχεδόν τρεις φορές τις παραμέτρους του προκατόχου του.
Ο αγωγός δεδομένων εκπαίδευσης επεκτάθηκε επίσης: Το Cognition τριπλασίασε τον αριθμό των περιβαλλόντων RL, πρόσθεσε επικαλύψεις που ακολουθούν τις οδηγίες και κατασκεύασε έναν σφόνδυλο που τροφοδοτείται από προηγούμενα σημεία ελέγχου SWE-2 που σκληραίνει επαναληπτικά τους επαληθευτές που χρησιμοποιούνται για τη βαθμολογία του μοντέλου.
Αποτελεσματικότητα όσο και Ευφυΐα
Η γνώση πλαισιώνει τα κέρδη του SWE-2 ως στενά συνδεδεμένα με την αποτελεσματικότητα. Η ισχυρότερη μηχανική κρίση, λέει η εταιρεία, επιτρέπει στον πράκτορα να γράφει πιο ολοκληρωμένες λύσεις με λιγότερες παρακάμψεις και περιττές αναγνώσεις. Στο FrontierCode 1.1 Main, η διαμόρφωση μέσης προσπάθειας του SWE-2 βαθμολογείται υψηλότερα από το SWE-1.7, ενώ παίρνει 58% λιγότερες στροφές και κοστίζει 81% λιγότερο.
Αυτό το πλαίσιο έχει σημασία για την επιχείρηση της Cognition. Ο Devin πωλείται ως αυτόνομος μηχανικός λογισμικού και το κόστος συμπερασμάτων αποτελεί άμεση συμβολή στην τιμολόγηση και στα περιθώρια. Ένα μοντέλο που διατηρεί ποιότητα γειτονικών συνόρων ενώ κόβει στροφές και μάρκες ανά εργασία αλλάζει τα οικονομικά κάθε συνεδρίας Devin που εξυπηρετεί η εταιρεία.
Διαθεσιμότητα
Το SWE-2 είναι διαθέσιμο από σήμερα στο Devin Desktop και το Devin CLI, ενώ η διάθεση στο Devin Web και το Fusion βρίσκεται σε εξέλιξη, σύμφωνα με την εταιρεία. Η Cognition λέει ότι οι χρήστες θα πρέπει να δουν το μοντέλο να εμφανίζεται σε όλες τις επιφάνειες τις επόμενες ημέρες.
Τι σημαίνει για την αγορά μοντέλων κωδικοποίησης
Η κυκλοφορία σφίγγει ένα ήδη γεμάτο πακέτο πίσω από το GPT-6 Astra. Η Cognition κατέχει τώρα ένα μοντέλο που ανταλλάσσει προσφορές από τα Anthropic, OpenAI και xAI σε σημαντικά χαμηλότερο κόστος και ελέγχει την πλήρη στοίβα από προϊόν μοντέλο σε αντιπρόσωπο. Οι αντίπαλοι θα αντιμετωπίσουν πίεση να ανταποκριθούν τόσο στην τιμή όσο και στην ικανότητα, ιδιαίτερα για εργασίες μεγάλου όγκου και μεσαίας δυσκολίας όπου το προφίλ κόστους του SWE-2 είναι το ισχυρότερο.
Για τους αγοραστές εργαλείων κωδικοποίησης τεχνητής νοημοσύνης, η πρακτική λύση είναι ότι η βοήθεια κωδικοποίησης σε επίπεδο συνόρων δεν απαιτεί πλέον τιμολόγηση σε επίπεδο συνόρων. Για τον υπόλοιπο κλάδο, το SWE-2 είναι απόδειξη ότι η μετα-εκπαίδευση και η αποτελεσματικότητα της υποδομής, όχι μόνο η κλίμακα βασικού μοντέλου, έχουν γίνει ένας αποφασιστικός ανταγωνιστικός μοχλός.
---
Μείνετε μπροστά από την τεχνητή νοημοσύνηΛάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.
Διαβάστε περισσότερα νέα AI →