Zespół Ornith wypuścił Ornith-1.5, rodzinę modeli językowych o otwartej wadze zbudowaną wokół niezwykłego pomysłu: model generuje własne zadania szkoleniowe, projektuje własne rusztowania i uczy się na podstawie własnych prób rozwiązań w ciągłej pętli. Według własnych ocen zespołu, flagowy Ornith-1.5-397B uzyskał 86,1 w teście Terminal-Bench 2.1 (Terminus-2), co plasuje go na równi z Claude Opus 4.8 firmy Anthropic z wynikiem 85,0 i wyprzedza każdy inny model open source porównywalnej wielkości.

Publikacja, opublikowana w tym tygodniu na blogu Ornith i w serwisie Hugging Face na licencji MIT, jest najnowszą salwą w wyścigu o sztuczną inteligencję o otwartym kodzie źródłowym, który regularnie przynosi rezultaty, które wcześniej uważano za niemożliwe bez budżetu pionierskiego laboratorium. Dla programistów i przedsiębiorstw śledzących najnowsze wiadomości dotyczące modelu sztucznej inteligencji znaczenie jest dwojakie: zgodność wzorca z wiodącym modelem zamkniętym oraz przepis szkoleniowy, który wskazuje, w jakim kierunku zmierza rozwój modelu otwartego.

Trzy rozmiary, jeden przepis

Ornith-1.5 jest dostępny w trzech konfiguracjach: flagowy model o parametrach 397B, złożony z mieszanki ekspertów, MoE 35B, który aktywuje tylko parametry 3B na token, oraz kompaktowy model o gęstości 9B ze skwantowanym wariantem „Mobile”, zaprojektowanym do działania bezpośrednio na urządzeniach iPhone i Android. Wszystkie trzy są dostępne w Hugging Face wraz z kompilacjami GGUF, MLX i NVFP4, a karty modeli wskazują, że rodzina jest zbudowana na architekturze Qwen3.5 MoE.

Pochodzenie ma tutaj znaczenie. Ornith-1.0, wydany na początku tego roku, spopularyzował podejście do kodowania agentycznego polegające na „samodzielnym rusztowaniu” i stał się cichym hitem — jego wersja 9B GGUF zarejestrowała ponad pięć milionów pobrań w serwisie Hugging Face. Ornith-1.5 rozszerza to środowisko z optymalizacji szkieletów i wdrożeń do pełnego procesu samodoskonalenia.

Wyjaśnienie pętli samodoskonalenia

W konwencjonalnym procesie poszkoleniowym uczenie się przez wzmacnianie opiera się na ustalonym zestawie zadań wybranych przez człowieka. Zamiast tego w Ornith-1.5 model sam proponuje nowe zadania, generuje rusztowanie specyficzne dla zadania — instrukcje, narzędzia i strategię dekompozycji użyte do rozwiązania problemu — a następnie generuje wdrożenia rozwiązań oceniane przez właśnie zbudowane rusztowanie. Nagroda jest propagowana wstecz przez wszystkie trzy etapy za pomocą GRPO, dzięki czemu system jednocześnie uczy się pisać lepsze zadania, lepsze rusztowania i lepsze rozwiązania.

Nagroda za wykonanie zadania jest sercem projektu. Każde proponowane zadanie jest oceniane na podstawie trzech sygnałów multiplikatywnych: trafności (czy szkielet działa i ocenia prawidłowo?), trudności granicznej (czy empiryczny wskaźnik sukcesu modelu jest bliski wartości docelowej wynoszącej około 20 procent, dzięki czemu zadania są trudne, ale możliwe do nauczenia się?) i nowości (czy wystarczająco różni się od wszystkiego w buforze wcześniej wygenerowanych zadań?). Ponieważ trudność mierzy się na podstawie aktualnego wskaźnika sukcesu modelu, program nauczania jest automatycznie zwiększany w miarę ulepszania modelu.

Zespół zgłasza również wyraźne środki zapobiegające hakerom podczas oceny: historia git jest usuwana z obrazów repozytoriów, więc modele nie mogą odzyskać wcześniejszych rozwiązań, a dostęp do sieci jest wyłączony, aby uniemożliwić modelom pobieranie odpowiedzi z zewnątrz. Wszystkie wyniki są uśredniane z pięciu niezależnych serii.

Liczby

Jeśli chodzi o kodowanie agentowe, wyniki zgłoszone przez statek flagowy znajdują się na szczycie listy rozwiązań open source. Na Terminal-Bench 2.1, przechodzącym przez uprząż Terminus-2, Ornith-1.5-397B 86.1 przewyższa Claude Opus 4.8 (85,0), DeepSeek-V4-Flash-0731 (82,7) i GLM-5.2 (81). W tym samym teście porównawczym z uprzężą Claude Code Ornith-1.5 uzyskał wynik 85,2 w porównaniu do 78,9 uzyskany w Opus 4.8. Na SWE-bench Verified obaj mają remis na poziomie 86,0 i 85,8, a Kimi K3 ma niewielką przewagę z wynikiem 86,2.

Luki pogłębiają się w przypadku trudniejszych zestawów agentów. W DeepSWE Ornith-1.5-397B uzyskuje wynik 56,0 — przed GLM-5.2 z wynikiem 46,2, choć za Opus 4,8 (59,0) i Kimi K3 (67,5). Najbardziej uderzający skok ma charakter pokoleniowy: Ornith-1.0 uzyskał zaledwie 8,0 w DeepSWE, co oznacza, że ​​nowa iteracja zapewnia siedmiokrotną poprawę w porównaniu z tą samą rodziną testów porównawczych.

Mniejsze modele opowiadają swoją własną historię. Ornith-1.5-35B-A3B, aktywujący tylko 3B parametrów na token, osiąga 68,5 punktów w Terminal-Bench 2.1 (Claude Code) w porównaniu do 43,4 dla Google Gemma 4-31B i 51,7 dla Meta's Muse Glimmer-30B oraz 79,0 w SWE-bench Verified. Model 9B osiąga 47,0 w Terminal-Bench 2.1, 70,6 w SWE-bench Verified i 86,4 w GPQA Diamond — liczby, które stawiają model klasy telefonicznej w zasięgu konkurentów w klasie komputerów stacjonarnych.

Zastrzeżenia i kontekst

Są to testy porównawcze opracowane przez programistów, a nie wyniki poddane niezależnemu audytowi, a modele porównawcze zostały ocenione przez zespół Ornith w ramach własnych ustawień uprzęży. Konkurencyjne laboratoria również dostosowują się do różnych kompromisów; Przewaga Kimi K3 w DeepSWE sugeruje, że granice działania oprogramowania agentowego są nadal kwestionowane. Jednak pełna przejrzystość publikacji – średnie z pięciu serii, opublikowane konfiguracje uprzęży, ujawnione zabezpieczenia – sprawia, że ​​niezależna reprodukcja jest niezwykle prosta.

Reakcja społeczności była znacząca. Ogłoszenie o wydaniu przyciągnęło w Hacker News znacznie ponad sto punktów w ciągu kilku godzin, a dyskusja skupiała się nie tyle na twierdzeniach dotyczących testów porównawczych, ile na metodologii samodoskonalenia, którą kilku komentatorów określiło jako jedną z bardziej wiarygodnych otwartych implementacji generowania zadań w stylu rekurencyjnym.

W przypadku ekosystemu open source Ornith-1.5 pojawia się w momencie, gdy otwarte modele z chińskich laboratoriów i niezależne zespoły z Zachodu wypełniają lukę, zamykając granice w zakresie kodowania i zadań agentycznych. Rodzina komputerów na licencji MIT, która pasuje do wiodącego modelu zamkniętego na platformie Terminal-Bench – i dostarcza wariant 9B przystosowany do telefonu – jeszcze bardziej zawęża tę lukę, a robi to za pomocą metody szkoleniowej, którą każdy może sprawdzić, odtworzyć i rozszerzyć.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →