Cognition, syarikat di belakang jurutera perisian Devin AI, melancarkan SWE-2 pada hari Khamis, menggambarkannya sebagai model pengekodannya yang paling maju. Dalam catatan blog yang diterbitkan pada 10 September, syarikat itu berkata model baharu itu menolak apa yang dipanggil sempadan Pareto bagi keupayaan dan kos, menjaringkan 50.0% pada penanda aras Utama FrontierCode 1.1 manakala kos 64% kurang daripada Fable 5.1, model Anthropic yang hanya satu mata di hadapannya pada 50.9%.
Pelancaran itu berlaku hampir sehari selepas Cognition mengesahkan pusingan pembiayaan $2 bilion pada penilaian $48 bilion, dan ia menandakan betapa agresifnya permulaan pengekodan ejen melabur dalam pembangunan modelnya sendiri dan bukannya bergantung semata-mata pada model sempadan pihak ketiga. Untuk liputan berterusan perlumbaan pengekodan AI dan segala-galanya yang menggerakkan industri, tandai halaman AI Buzz Wire, sumber harian anda untuk berita terkini AI.
Tempat SWE-2 Mendarat di Penanda Aras
Menurut hasil Cognition yang diterbitkan, SWE-2 menyiarkan 50.0% pada FrontierCode 1.1 Utama, mendahului Grok 4.6 pada 48.0% dan GPT-5.6 Sol pada 47.5%, dan dalam jarak yang menarik dari GPT-6 Astra, yang mendahului bidang itu pada 53.3%. Pada penanda aras DeepSWE 1.1, SWE-2 mencapai 73.0%, kedua selepas 74.1% Astra dalam senarai model Cognition.
Persembahan terkuat datang pada Terminal-Bench 2.1, di mana SWE-2 mendapat markah 92.8%, angka tertinggi dalam jadual perbandingan Kognisi dan mendahului Fable 5.1 pada 91.4% dan GPT-6 Astra pada 89.9%. Gambar berubah pada Terminal-Bench 4 yang lebih keras, di mana SWE-2 menguruskan 27.3% berbanding 57.9% untuk GPT-6 Astra dan 55.8% untuk Fable 5.1, peringatan bahawa reka bentuk kecekapan pertama model meninggalkan ruang kepala di bahagian atas kesukaran tugasan.
Kognisi merumuskan kedudukan secara terang-terangan: pada FrontierCode 1.1 Utama dan DeepSWE 1.1, SWE-2 mengalahkan model sebelumnya SWE-1.7 dan Grok 4.6 pada kedua-dua skor dan kos, sepadan dengan GPT-5.6 Sol dan Fable 5/5.1 pada sebahagian kecil daripada harganya, dan terdapat dalam beberapa mata pada suku GPT-6.
Pasca Latihan Daripada Kimi K3 pada Skala Multi-Trillion
SWE-2 tidak dibina dari awal. Kognisi telah melatih model daripada Kimi K3, model asas 2.8 trilion parameter daripada Moonshot AI yang telah pun menjalani pembelajaran pengukuhan yang meluas untuk pengekodan agen. Di samping asas itu, Cognition berkata proses RLnya menambah lima hingga enam mata pada banyak penanda aras dan mengubah keseluruhan sempadan prestasi kos K3.
Syarikat itu berkata SWE-2 adalah kali pertama ia mempertingkatkan pembelajaran pengukuhan kepada rejim multi-trilion parameter, membina infrastruktur latihan dan resipi yang dibangunkan untuk SWE-1.7. Penambahan utama ialah algoritma RL yang melatih semua peringkat usaha penaakulan dalam satu larian, dan bukannya menganggap usaha rendah, sederhana dan tinggi sebagai sasaran latihan yang berasingan.
Penalti Kos Membentuk Seluruh Sempadan
Idea utama dalam latihan SWE-2 ialah penalti kos linear yang digunakan setiap tahap usaha dalam satu larian RL, dengan setiap penalti ditala ke cerun tempatan sempadan Pareto model asas. Kognisi mengatakan pendekatan ini, yang diperoleh daripada prinsip pertama, memajukan keseluruhan sempadan prestasi kos model sambil mengekalkan bentuknya dan mencerminkan kos pengguna sebenar sekerap mungkin dalam latihan.
Syarikat itu juga memperincikan garis dasar ganjaran berwajaran panjang yang telah digunakan sejak SWE-1.6, yang dikreditkannya dengan latihan yang menstabilkan dengan ketara, di samping penambahbaikan pada penyampaian pelancaran RL yang termasuk model draf dalam talian untuk meningkatkan daya pemprosesan penyahkodan. Dengan kernel NVFP4 dan FP8 dan latihan sedar pengkuantitian, Cognition mengatakan ia mengurangkan penggunaan memori keseluruhan walaupun model asas mempunyai hampir tiga kali parameter pendahulunya.
Saluran paip data latihan turut berkembang: Kognisi menggandakan bilangan persekitaran RL tiga kali ganda, menambah tindanan mengikut arahan dan membina roda tenaga yang dikuasakan oleh pusat pemeriksaan SWE-2 sebelumnya yang secara berulang mengeraskan pengesah yang digunakan untuk menjaringkan model.
Kecekapan Sama Seperti Kepintaran
Kognisi membingkaikan keuntungan SWE-2 sebagai berkait rapat dengan kecekapan. Pertimbangan kejuruteraan yang lebih kukuh, kata syarikat itu, membolehkan ejen menulis penyelesaian yang lebih lengkap dengan lebih sedikit lencongan dan bacaan yang berlebihan. Pada FrontierCode 1.1 Utama, konfigurasi usaha sederhana SWE-2 mendapat markah lebih tinggi daripada SWE-1.7 sambil mengambil 58% lebih sedikit pusingan dan kos 81% lebih rendah.
Pembingkaian itu penting untuk perniagaan Kognisi. Devin dijual sebagai jurutera perisian autonomi, dan kos inferens ialah input langsung kepada harga dan margin. Model yang memegang kualiti bersebelahan sempadan sambil memotong selekoh dan token setiap tugas mengubah ekonomi setiap sesi Devin yang dilayan oleh syarikat itu.
Ketersediaan
SWE-2 boleh didapati mulai hari ini dalam Devin Desktop dan Devin CLI, dengan pelancaran pada Devin Web dan Fusion sedang dijalankan, menurut syarikat itu. Kognisi mengatakan pengguna harus melihat model itu muncul di seluruh permukaan dalam beberapa hari akan datang.
Maksudnya untuk Pasaran Model Pengekodan
Pelepasan mengetatkan pek yang sudah sesak di belakang GPT-6 Astra. Kognisi kini memiliki model yang bertukar hebat dengan tawaran daripada Anthropic, OpenAI dan xAI pada kos yang jauh lebih rendah, dan ia mengawal susunan penuh daripada model kepada produk ejen. Saingan akan menghadapi tekanan untuk bertindak balas pada harga sama seperti pada keupayaan, terutamanya untuk tugasan bervolume tinggi, sederhana-sukar di mana profil kos SWE-2 adalah paling kukuh.
Bagi pembeli alat pengekodan AI, manfaat praktikal ialah bantuan pengekodan peringkat sempadan tidak lagi memerlukan penetapan harga peringkat sempadan. Bagi industri yang lain, SWE-2 adalah bukti bahawa kecekapan pasca latihan dan infrastruktur, bukan hanya skala model asas, telah menjadi tuil daya saing yang menentukan.
---
Kekal Mendahului AIDapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →