Tým Ornith vydal Ornith-1.5, rodinu jazykových modelů s otevřenou váhou postavenou na neobvyklé myšlence: model generuje své vlastní tréninkové úkoly, navrhuje vlastní lešení a učí se z vlastních pokusů o řešení v nepřetržitě běžící smyčce. Podle vlastního hodnocení týmu má vlajková loď Ornith-1.5-397B skóre 86,1 na Terminal-Bench 2.1 (Terminus-2), čímž se rovná Claude Opus 4.8 od Anthropic s 85,0 a předčí všechny ostatní open-source modely srovnatelné velikosti.
Vydání, zveřejněné tento týden na blogu Ornith a na Hugging Face pod licencí MIT, je nejnovější salvou v závodě AI s otevřeným zdrojovým kódem, který pravidelně přináší výsledky, které byly dříve považovány za nemožné bez rozpočtu hraniční laboratoře. Pro vývojáře a podniky, které sledují nejnovější novinky o modelu AI, je význam dvojí: parita benchmarku s předním uzavřeným modelem a tréninkový recept, který ukazuje, kam bude vývoj otevřeného modelu dále směřovat.
Tři velikosti, jeden recept
Ornith-1.5 se dodává ve třech konfiguracích: vlajková loď expertů s parametry 397B, 35B MoE, která aktivuje pouze 3B parametry na token, a kompaktní 9B hustý model s kvantovanou „mobilní“ variantou navrženou tak, aby běžela přímo na zařízeních iPhone a Android. Všechny tři jsou k dispozici na Hugging Face spolu se sestaveními GGUF, MLX a NVFP4 a karty modelu ukazují, že rodina je postavena na architektuře Qwen3.5 MoE.
Zde záleží na rodokmenu. Ornith-1.0, vydaný počátkem tohoto roku, zpopularizoval přístup „self-scaffolding“ ke kódování agentů a stal se tichým hitem – jeho sestavení 9B GGUF zaznamenalo více než pět milionů stažení na Hugging Face. Ornith-1.5 rozšiřuje tento rámec z optimalizace lešení a zavádění do úplného procesu sebezdokonalování.
Smyčka sebezdokonalení, vysvětleno
V konvenčním potréninkovém potrubí probíhá učení posilování proti pevné sadě lidsky řízených úkolů. Ornith-1.5 má místo toho samotný model navrhnout nové úlohy, vygenerovat lešení specifické pro úlohu – instrukce, nástroje a strategii rozkladu používané k napadení problému – a poté vytvořit zavedení řešení, která jsou ohodnocena lešením, které právě vytvořil. Odměna se šíří zpět ve všech třech fázích pomocí GRPO, takže se systém současně učí psát lepší úkoly, lepší skafoldy a lepší řešení.
Odměna za generování úkolů je srdcem designu. Každý navrhovaný úkol je hodnocen na základě tří multiplikativních signálů: validita (provádí se lešení a vyhodnocuje se správně?), hraniční obtížnost (blíží se empirická úspěšnost modelu k cíli zhruba 20 procent, úkoly jsou náročné, ale lze se je naučit?) a novost (je dostatečně odlišný od všeho ve vyrovnávací paměti dříve vygenerovaných úkolů?). Protože se obtížnost měří podle aktuální úspěšnosti modelu, kurikulum se automaticky eskaluje, jak se model zlepšuje.
Tým také během hodnocení hlásí explicitní opatření proti hackerům: historie git je odstraněna z obrázků úložiště, takže modely nemohou obnovit předchozí řešení, a přístup k síti je zakázán, aby modely nemohly načítat externí odpovědi. Všechny výsledky jsou zprůměrovány z pěti nezávislých běhů.
Čísla
Pokud jde o agentní kódování, výsledky vlajkové lodi samy o sobě se shlukují v horní části pole s otevřeným zdrojovým kódem. Na Terminal-Bench 2.1 běžte přes kabelový svazek Terminus-2, 86.1 Ornith-1.5-397B překonává Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) a GLM-5.2 (81). Ve stejném benchmarku, který prošel pomocí Claude Code, Ornith-1.5 vykazuje 85.2 oproti Opus 4.8 78.9. Na SWE-bench Verified jsou tyto dva fakticky nerozhodné na 86,0 a 85,8, přičemž Kimi K3 má mírný náskok na 86,2.
Mezery se rozšiřují na těžších agentských sadách. Na DeepSWE má Ornith-1,5-397B skóre 56,0 — před GLM-5,2 46,2, i když za Opus 4,8 (59,0) a Kimi K3 (67,5). Nejvýraznější skok je generační: Ornith-1.0 dosáhl na DeepSWE pouhých 8,0, což znamená, že nová iterace přináší sedminásobné zlepšení ve stejné rodině benchmarků.
Menší modely vyprávějí svůj vlastní příběh. Ornith-1.5-35B-A3B, aktivující pouze 3B parametry na token, skóre 68.5 na Terminal-Bench 2.1 (Claude Code) oproti 43.4 pro Google Gemma 4-31B a 51.7 pro Meta's Muse Glimmer-30B a příspěvky na SWEchben 79.0 Model 9B dosahuje 47,0 na Terminal-Bench 2.1, 70,6 na SWE-bench Verified a 86,4 na GPQA Diamond – čísla, díky nimž je model třídy telefonů na dosah od konkurentů třídy stolních počítačů.
Upozornění a kontext
Jedná se o vývojářské benchmarky, nikoli nezávisle auditované výsledky, a srovnávací modely byly vyhodnoceny týmem Ornith v rámci vlastního nastavení svazku. Konkurenční laboratoře také ladí na různé kompromisy; Náskok Kimi K3 na DeepSWE naznačuje, že hranice práce s agentským softwarem je stále sporná. Ale transparentnost celé tabulky vydání – pětinásobné průměry, publikované konfigurace svazků, zveřejněná ochranná opatření – činí nezávislou reprodukci neobvykle přímočarou.
Odezva komunity byla značná. Oznámení o vydání přitáhlo více než sto bodů na Hacker News během několika hodin, přičemž diskuse se soustředila méně na požadavky srovnávacích testů jako na metodologii sebezdokonalování, kterou několik komentátorů označilo za jednu z důvěryhodnějších otevřených implementací generování úkolů ve stylu rekurzivního stylu.
Co se týče open-source ekosystému, Ornith-1.5 přistává v okamžiku, kdy otevřené modely z čínských laboratoří a západních nezávislých týmů uzavírají mezeru uzavřenými hranicemi v kódování a agentních úlohách. Řada licencovaná MIT, která se shoduje s předním uzavřeným modelem na Terminal-Bench – a dodává variantu 9B připravenou pro telefon – tuto mezeru dále zužuje a dělá to pomocí tréninkové metody, kterou může kdokoli zkontrolovat, reprodukovat a rozšířit.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →