Tim Ornith wis dirilis Ornith-1.5, kulawarga model basa mbukak-bobot dibangun watara idea mboten umum: model njedulake tugas latihan dhewe, ngrancang scaffolds dhewe, lan sinau saka nyoba solusi dhewe ing daur ulang terus-terusan. Miturut evaluasi tim kasebut, kapal penggedhe Ornith-1.5-397B ngetung 86.1 ing Terminal-Bench 2.1 (Terminus-2), cocog karo Anthropic's Claude Opus 4.8 ing 85.0 lan luwih dhisik tinimbang saben model open-source liyane sing ukurane padha.
Rilis kasebut, sing diterbitake minggu iki ing blog Ornith lan ing Hugging Face ing sangisore lisensi MIT, minangka salvo paling anyar ing balapan AI open-source sing ajeg ngasilake asil sing ora bisa ditindakake tanpa anggaran lab perbatasan. Kanggo pangembang lan perusahaan sing nelusuri kabar model AI paling anyar, maknane ana loro: paritas pathokan karo model tertutup sing unggul, lan resep latihan sing nuduhake ing ngendi pangembangan model mbukak bakal maju.
Telung Ukuran, Siji Resep
Ornith-1.5 dikirim ing telung konfigurasi: kapal penggedhe campuran 397B-parameter, MoE 35B sing ngaktifake mung paramèter 3B saben token, lan model padhet 9B sing kompak kanthi varian "Mobile" sing dirancang kanggo mbukak langsung ing piranti iPhone lan Android. Kabeh telu kasedhiya ing Hugging Face bebarengan karo GGUF, MLX, lan NVFP4, lan kertu model nuduhake yen kulawarga dibangun ing arsitektur Qwen3.5 MoE.
Silsilah penting ing kene. Ornith-1.0, dirilis awal taun iki, popularized "self-scaffolding" pendekatan kanggo agen coding lan dadi hit sepi - sawijining 9B GGUF mbangun wis mlebu luwih saka limang yuta download ing Hugging Face. Ornith-1.5 ngluwihi kerangka kasebut saka ngoptimalake scaffolds lan rollouts menyang pipeline lengkap dandan diri.
Loop Self-Damel, Dijelasake
Ing jalur pipa pasca-latihan konvensional, sinau penguatan lumaku nglawan seperangkat tugas sing dikurasi manungsa. Ornith-1.5 tinimbang duwe model dhewe ngusulake tugas anyar, ngasilake perancah khusus tugas - instruksi, alat, lan strategi dekomposisi sing digunakake kanggo nyerang masalah kasebut - banjur ngasilake solusi solusi sing dicetak dening scaffold sing dibangun. Ganjaran disebarake maneh liwat kabeh telung tahap nggunakake GRPO, supaya sistem kasebut sinau nulis tugas sing luwih apik, perancah sing luwih apik, lan solusi sing luwih apik.
Ganjaran generasi tugas minangka jantung desain. Saben tugas sing diusulake diwenehi skor ing telung sinyal multiplicative: validitas (apa scaffold nglakokake lan ngevaluasi kanthi bener?), Kesulitan wates (apa tingkat sukses empiris model cedhak target kira-kira 20 persen, tetep tugas sing tantangan nanging bisa dipelajari?), lan anyar (apa cukup beda karo kabeh tugas sing wis digawe sadurunge?). Amarga kangelan diukur marang tingkat sukses model saiki, kurikulum kanthi otomatis mundhak nalika model nambah.
Tim kasebut uga nglaporake langkah-langkah anti-peretasan sing eksplisit sajrone evaluasi: riwayat git dicopot saka gambar repositori supaya model ora bisa mbalekake solusi sadurunge, lan akses jaringan dipateni kanggo nyegah model njupuk jawaban eksternal. Kabeh asil rata-rata liwat limang roto independen.
Angka
Ing coding agen, kluster asil sing dilaporake dhewe ing ndhuwur lapangan sumber terbuka. Ing Terminal-Bench 2.1 mbukak liwat sabuk Terminus-2, Ornith-1.5-397B 86.1 metu Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7), lan GLM-5.2 (81). Ing pathokan padha mlaku liwat Claude Code harness, Ornith-1.5 kiriman 85.2 marang Opus 4.8 78.9. Ing SWE-bench Verified, loro sing èfèktif disambungake ing 86,0 lan 85,8, karo Kimi K3 rada ahead ing 86,2.
Kesenjangan nggedhekake ing suite agen sing luwih angel. On DeepSWE, Ornith-1.5-397B skor 56.0 - ahead saka GLM-5.2 kang 46.2, sanadyan konco Opus 4.8 (59.0) lan Kimi K3 (67.5). Lompat sing paling nggumunake yaiku generasi: Ornith-1.0 mung ngetung 8.0 ing DeepSWE, tegese pengulangan anyar menehi dandan kaping pitu ing kulawarga pathokan sing padha.
Model cilik nyritakake critane dhewe. Ornith-1.5-35B-A3B, mung ngaktifake paramèter 3B saben token, skor 68.5 ing Terminal-Bench 2.1 (Kode Claude) mungsuh 43.4 kanggo Google Gemma 4-31B lan 51.7 kanggo Meta Muse Glimmer-30B, lan ing SWE-bench Verified. Model 9B tekan 47.0 ing Terminal-Bench 2.1, 70.6 ing SWE-bench Verified, lan 86.4 ing GPQA Diamond - nomer sing sijine model kelas telpon ing kadohan striking saingan kelas desktop.
Peringatan lan Konteks
Iki minangka pathokan sing dikembangake dening pangembang, ora asil audit independen, lan model perbandingan kasebut dievaluasi dening tim Ornith miturut setelan sabuk dhewe. Lab saingan uga cocog kanggo macem-macem trade-off; Pimpinan Kimi K3 ing DeepSWE nyaranake wates karya piranti lunak agenik isih ditandingi. Nanging transparansi meja lengkap rilis - rata-rata limang mlaku, konfigurasi sabuk sing diterbitake, perlindungan sing diungkapake - nggawe reproduksi mandiri ora biasa.
Tanggapan masyarakat wis akeh banget. Pengumuman rilis narik luwih saka satus poin ing Hacker News sajrone sawetara jam, kanthi diskusi kurang fokus ing pratelan pathokan tinimbang babagan metodologi perbaikan diri, sing diterangake sawetara komentator minangka salah sawijining implementasi mbukak sing luwih dipercaya saka generasi tugas gaya rekursif.
Kanggo ekosistem sumber terbuka, Ornith-1.5 ndharat nalika model mbukak saka lab China lan tim independen Barat wis nutup celah kasebut kanthi wates tertutup babagan tugas coding lan agen. Kulawarga sing dilisensi MIT sing cocog karo model tertutup sing misuwur ing Terminal-Bench - lan ngirim varian 9B sing siap telpon - nyepetake jurang kasebut, lan nindakake kanthi cara latihan sing sapa wae bisa mriksa, ngasilake, lan ngluwihi.
---
Tetep Ahead of AIEntuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.
Waca liyane AI warta →