Pasukan Ornith telah mengeluarkan Ornith-1.5, sebuah keluarga model bahasa berwajaran terbuka yang dibina berdasarkan idea luar biasa: model menjana tugas latihannya sendiri, mereka bentuk perancahnya sendiri dan belajar daripada percubaan penyelesaiannya sendiri dalam gelung yang berjalan secara berterusan. Menurut penilaian pasukan itu sendiri, Ornith-1.5-397B unggulan mendapat markah 86.1 pada Terminal-Bench 2.1 (Terminus-2), meletakkannya setanding dengan Anthropic's Claude Opus 4.8 pada 85.0 dan mendahului setiap model sumber terbuka lain yang mempunyai saiz yang setanding.

Keluaran, yang diterbitkan minggu ini di blog Ornith dan di Hugging Face di bawah lesen MIT, adalah salvo terbaru dalam perlumbaan AI sumber terbuka yang kerap menghasilkan keputusan yang pernah dianggap mustahil tanpa belanjawan makmal sempadan. Bagi pembangun dan perusahaan yang menjejaki berita model AI terbaharu, kepentingannya adalah dua kali ganda: pariti penanda aras dengan model tertutup terkemuka dan resipi latihan yang menunjukkan arah pembangunan model terbuka seterusnya.

Tiga Saiz, Satu Resipi

Ornith-1.5 dihantar dalam tiga konfigurasi: unggulan 397B-parameter campuran pakar, 35B MoE yang mengaktifkan hanya parameter 3B bagi setiap token dan model padat 9B yang padat dengan varian "Mudah Alih" terkuantiti yang direka untuk dijalankan terus pada peranti iPhone dan Android. Ketiga-tiganya tersedia pada Hugging Face bersama binaan GGUF, MLX dan NVFP4, dan kad model menunjukkan keluarga dibina pada seni bina Qwen3.5 MoE.

Keturunan penting di sini. Ornith-1.0, dikeluarkan awal tahun ini, mempopularkan pendekatan "perancah kendiri" kepada pengekodan agen dan menjadi popular — binaan 9B GGUFnya telah mencatatkan lebih daripada lima juta muat turun pada Hugging Face. Ornith-1.5 memanjangkan rangka kerja itu daripada mengoptimumkan perancah dan pelancaran kepada saluran paip pembaikan diri sepenuhnya.

Gelung Pembaikan Diri, Diterangkan

Dalam saluran paip pasca latihan konvensional, pembelajaran pengukuhan berjalan dengan satu set tetap tugasan yang dipilih oleh manusia. Ornith-1.5 sebaliknya meminta model itu sendiri mencadangkan tugasan baharu, menjana perancah khusus tugas — arahan, alatan dan strategi penguraian yang digunakan untuk menyerang masalah — dan kemudian menghasilkan pelancaran penyelesaian yang dijaringkan oleh perancah yang baru dibinanya. Ganjaran disebarkan kembali melalui ketiga-tiga peringkat menggunakan GRPO, jadi sistem belajar secara serentak untuk menulis tugas yang lebih baik, perancah yang lebih baik dan penyelesaian yang lebih baik.

Ganjaran penjanaan tugas adalah nadi reka bentuk. Setiap tugasan yang dicadangkan diberi markah pada tiga isyarat darab: kesahan (adakah perancah melaksanakan dan menilai dengan betul?), kesukaran sempadan (adakah kadar kejayaan empirikal model menghampiri sasaran kira-kira 20 peratus, memastikan tugasan mencabar tetapi boleh dipelajari?), dan kebaharuan (adakah ia cukup berbeza daripada segala-galanya dalam penampan tugasan yang dijana sebelumnya?). Kerana kesukaran diukur berbanding kadar kejayaan semasa model itu sendiri, kurikulum secara automatik meningkat apabila model bertambah baik.

Pasukan itu juga melaporkan langkah anti-penggodaman yang jelas semasa penilaian: sejarah git dilucutkan daripada imej repositori supaya model tidak dapat memulihkan penyelesaian terdahulu dan akses rangkaian dilumpuhkan untuk menghalang model daripada mengambil jawapan luaran. Semua keputusan dipuratakan dalam lima larian bebas.

Nombor

Mengenai pengekodan agen, kumpulan hasil yang dilaporkan sendiri perdana di bahagian atas medan sumber terbuka. Pada Terminal-Bench 2.1 dijalankan melalui abah-abah Terminus-2, 86.1 Ornith-1.5-397B keluar dari Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) dan GLM-5.2 (81). Pada penanda aras yang sama dijalankan melalui abah-abah Claude Code, Ornith-1.5 mencatatkan 85.2 berbanding 78.9 Opus 4.8. Pada SWE-bench Verified, kedua-duanya terikat secara berkesan pada 86.0 dan 85.8, dengan Kimi K3 di hadapan sedikit pada 86.2.

Jurang semakin meluas pada suite agenik yang lebih keras. Pada DeepSWE, Ornith-1.5-397B mendapat 56.0 — mendahului GLM-5.2 46.2, walaupun di belakang Opus 4.8 (59.0) dan Kimi K3 (67.5). Lonjakan yang paling menarik adalah generasi: Ornith-1.0 hanya mendapat 8.0 pada DeepSWE, bermakna lelaran baharu memberikan peningkatan tujuh kali ganda pada keluarga penanda aras yang sama.

Model yang lebih kecil menceritakan kisah mereka sendiri. Ornith-1.5-35B-A3B, mengaktifkan parameter 3B sahaja bagi setiap token, mendapat markah 68.5 pada Terminal-Bench 2.1 (Claude Code) berbanding 43.4 untuk Gemma 4-31B Google dan 51.7 untuk Meta's Muse Glimmer-30B, dan siaran 79.0 Verified Model 9B mencapai 47.0 pada Terminal-Bench 2.1, 70.6 pada SWE-bench Verified, dan 86.4 pada GPQA Diamond — nombor yang meletakkan model kelas telefon dalam jarak yang ketara daripada pesaing kelas desktop.

Kaveat dan Konteks

Ini adalah penanda aras yang dikendalikan oleh pembangun, bukan hasil yang diaudit secara bebas, dan model perbandingan telah dinilai oleh pasukan Ornith di bawah tetapan abah-abahnya sendiri. Makmal saingan juga menyesuaikan pertukaran yang berbeza; Pemimpin Kimi K3 di DeepSWE mencadangkan sempadan kerja perisian ejen masih dipertandingkan. Tetapi ketelusan jadual penuh keluaran — purata lima larian, konfigurasi abah-abah yang diterbitkan, perlindungan yang didedahkan — menjadikan pengeluaran semula bebas luar biasa mudah.

Sambutan masyarakat sangat besar. Pengumuman keluaran itu memperoleh lebih seratus mata pada Berita Hacker dalam beberapa jam, dengan perbincangan kurang tertumpu pada tuntutan penanda aras berbanding metodologi peningkatan diri, yang disifatkan beberapa pengulas sebagai salah satu pelaksanaan terbuka yang lebih boleh dipercayai bagi penjanaan tugas gaya rekursif.

Untuk ekosistem sumber terbuka, Ornith-1.5 mendarat pada saat model terbuka dari makmal China dan pasukan bebas Barat telah menutup jurang dengan sempadan tertutup pada tugas pengekodan dan agen. Keluarga berlesen MIT yang sepadan dengan model tertutup terkemuka di Terminal-Bench — dan menghantar varian 9B sedia telefon — mengecilkan lagi jurang itu, dan melakukannya dengan kaedah latihan yang boleh diperiksa, dihasilkan semula dan dilanjutkan oleh sesiapa sahaja.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →