Echipa Ornith a lansat Ornith-1.5, o familie de modele de limbaj deschise construite în jurul unei idei neobișnuite: modelul își generează propriile sarcini de antrenament, își proiectează propriile schele și învață din propriile încercări de soluții într-o buclă care rulează continuu. Conform propriilor evaluări ale echipei, modelul emblematic Ornith-1.5-397B are 86,1 pe Terminal-Bench 2.1 (Terminus-2), plasându-l la egalitate cu Claude Opus 4.8 de la Anthropic la 85,0 și înaintea oricărui alt model open-source de dimensiuni comparabile.
Lansarea, publicată săptămâna aceasta pe blogul Ornith și pe Hugging Face sub o licență MIT, este cea mai recentă salvă din cursa open-source AI, care a produs în mod regulat rezultate când se credeau imposibile fără bugetul unui laborator de frontieră. Pentru dezvoltatorii și întreprinderile care urmăresc cele mai recente știri despre modelul AI, semnificația este dublă: paritatea de referință cu un model închis de frunte și o rețetă de instruire care indică spre ce se îndreaptă dezvoltarea modelului deschis.
Trei dimensiuni, o singură rețetă
Ornith-1.5 este livrat în trei configurații: un flagship cu un amestec de experți cu parametri 397B, un MoE 35B care activează doar 3B parametri pe token și un model compact 9B dens, cu o variantă „Mobile” cuantificată, concepută pentru a rula direct pe dispozitive iPhone și Android. Toate trei sunt disponibile pe Hugging Face alături de versiunile GGUF, MLX și NVFP4, iar cardurile model indică faptul că familia este construită pe arhitectura Qwen3.5 MoE.
Genealogia contează aici. Ornith-1.0, lansat la începutul acestui an, a popularizat abordarea „auto-schelă” a codării agentice și a devenit un succes liniștit – versiunea sa 9B GGUF a înregistrat peste cinci milioane de descărcări pe Hugging Face. Ornith-1.5 extinde acest cadru de la optimizarea schelelor și lansărilor într-o conductă completă de auto-îmbunătățire.
Bucla de auto-îmbunătățire, explicată
Într-o conductă convențională post-formare, învățarea prin consolidare se desfășoară pe un set fix de sarcini organizate de oameni. Ornith-1.5 are în schimb modelul însuși să propună noi sarcini, să genereze o schelă specifică sarcinii - instrucțiunile, instrumentele și strategia de descompunere utilizate pentru a ataca problema - și apoi să producă lansări de soluții care sunt punctate de schela pe care tocmai l-a construit. Recompensa este propagată înapoi prin toate cele trei etape folosind GRPO, astfel încât sistemul învață simultan să scrie sarcini mai bune, schele mai bune și soluții mai bune.
Recompensa de generare a sarcinilor este inima designului. Fiecare sarcină propusă este punctată pe trei semnale multiplicative: validitate (schela execută și evaluează corect?), dificultate de frontieră (rata de succes empirică a modelului este aproape de o țintă de aproximativ 20 la sută, menținând sarcinile provocatoare, dar de învățat?) și noutate (este suficient de diferit de tot ceea ce se află într-un tampon de sarcini generate anterior?). Deoarece dificultatea este măsurată în raport cu rata de succes actuală a modelului, curriculum-ul crește automat pe măsură ce modelul se îmbunătățește.
Echipa raportează, de asemenea, măsuri explicite anti-hacking în timpul evaluării: istoricul git este eliminat din imaginile din depozit, astfel încât modelele să nu poată recupera soluțiile anterioare, iar accesul la rețea este dezactivat pentru a împiedica modelele să preia răspunsuri externe. Toate rezultatele sunt mediate pe cinci runde independente.
Numerele
În ceea ce privește codificarea agentică, rezultatele auto-raportate ale navei emblematice se grupează în partea de sus a câmpului open-source. Pe Terminal-Bench 2.1, treceți prin hamul Terminus-2, 86.1 al lui Ornith-1.5-397B îl depășește pe Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) și GLM-5.2 (81). Pe același test de referință prin hamul Claude Code, Ornith-1.5 postează 85,2 față de 78,9 pentru Opus 4.8. Pe SWE-bench Verified, cei doi sunt efectiv la egalitate la 86,0 și 85,8, cu Kimi K3 ușor înainte la 86,2.
Lacunele se lărgesc pe suitele agentice mai dure. Pe DeepSWE, Ornith-1.5-397B are 56,0 - înaintea lui GLM-5.2 cu 46,2, deși în urma lui Opus 4.8 (59.0) și Kimi K3 (67.5). Cel mai izbitor salt este generațional: Ornith-1.0 a obținut doar 8,0 la DeepSWE, ceea ce înseamnă că noua iterație oferă o îmbunătățire de șapte ori față de aceeași familie de referințe.
Modelele mai mici își spun propria poveste. Ornith-1.5-35B-A3B, activând doar 3B parametrii pe token, are scoruri de 68,5 pe Terminal-Bench 2.1 (Claude Code) față de 43,4 pentru Gemma 4-31B de la Google și 51,7 pentru Muse Glimmer-30B de la Meta și postează 79.0 pe SWE-bench Verified. Modelul 9B ajunge la 47,0 pe Terminal-Bench 2.1, 70,6 pe SWE-bench Verified și 86,4 pe GPQA Diamond - cifre care plasează un model de clasă de telefon la distanță izbitoare de rivalii din clasa desktop-ului.
Avertismente și context
Acestea sunt benchmark-uri administrate de dezvoltatori, nu rezultate auditate independent, iar modelele de comparație au fost evaluate de echipa Ornith în propriile setări de cablaj. Laboratoarele rivale se adaptează și pentru diferite compromisuri; Conducerea lui Kimi K3 pe DeepSWE sugerează că frontiera muncii de software agentic este încă contestată. Dar transparența completă a versiunii - medii de cinci runde, configurații publicate de cablaj, garanții dezvăluite - face reproducerea independentă neobișnuit de simplă.
Răspunsul comunității a fost substanțial. Anunțul de lansare a atras peste o sută de puncte pe Hacker News în câteva ore, discuțiile s-au concentrat mai puțin pe afirmațiile de referință decât pe metodologia de auto-îmbunătățire, pe care mai mulți comentatori au descris-o ca fiind una dintre cele mai credibile implementări deschise ale generării sarcinilor în stil recursiv.
Pentru ecosistemul open-source, Ornith-1.5 aterizează într-un moment în care modelele deschise din laboratoarele Chinei și echipele independente occidentale au redus decalajul cu frontierele închise în ceea ce privește codificarea și sarcinile agentice. O familie licențiată de MIT care se potrivește cu un model închis de frunte pe Terminal-Bench – și oferă o variantă 9B pregătită pentru telefon – restrânge și mai mult acest decalaj și o face cu o metodă de antrenament pe care oricine o poate inspecta, reproduce și extinde.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →