Команда Ornith випустила Ornith-1.5, сімейство відкритих мовних моделей, побудованих навколо незвичайної ідеї: модель генерує власні навчальні завдання, проектує власні каркаси та вчиться на власних спробах вирішення в безперервному циклі. Згідно з власними оцінками команди, флагман Ornith-1.5-397B набирає 86,1 балів на Terminal-Bench 2.1 (Terminus-2), що ставить його на один рівень із Claude Opus 4.8 від Anthropic із 85,0 і випереджає будь-яку іншу модель із відкритим вихідним кодом порівнянного розміру.

Реліз, опублікований цього тижня в блозі Ornith і на Hugging Face за ліцензією Массачусетського технологічного інституту, є останнім залпом у гонці штучного інтелекту з відкритим кодом, яка регулярно приносила результати, які раніше вважалися неможливими без бюджету передової лабораторії. Для розробників і підприємств, які відстежують [останні новини про модель штучного інтелекту] (https://aibuzzwire.news), це має подвійне значення: паритет тестів із провідною закритою моделлю та навчальний рецепт, який вказує, куди далі йде розробка відкритої моделі.

Три розміри, один рецепт

Ornith-1.5 постачається в трьох конфігураціях: флагман з комбінацією експертів із 397B параметрами, MoE 35B, який активує лише 3B параметри на токен, і компактна 9B щільна модель із квантованим «Мобільним» варіантом, призначена для роботи безпосередньо на пристроях iPhone і Android. Усі три доступні на Hugging Face разом зі збірками GGUF, MLX і NVFP4, а картки моделей вказують на те, що сімейство побудовано на архітектурі Qwen3.5 MoE.

Тут має значення походження. Ornith-1.0, випущений на початку цього року, популяризував підхід до агентного кодування «самостійного створення» та став тихим хітом — його збірка 9B GGUF зареєструвала понад п’ять мільйонів завантажень на Hugging Face. Ornith-1.5 розширює цю структуру від оптимізації каркасів і розгортань до повного конвеєра самовдосконалення.

Петля самовдосконалення, пояснення

У звичайному конвеєрі після тренінгу навчання з підкріпленням виконується проти фіксованого набору завдань, які курує людина. Натомість у Ornith-1.5 модель сама пропонує нові завдання, генерує спеціальний каркас для завдань — інструкції, інструменти та стратегію декомпозиції, які використовуються для вирішення проблеми, — а потім створює розгортання рішень, які оцінюються щойно створеним каркасом. Винагорода повертається через усі три етапи за допомогою GRPO, тому система одночасно вчиться писати кращі завдання, кращі шаблони та кращі рішення.

Винагорода за створення завдань є серцевиною дизайну. Кожне запропоноване завдання оцінюється за трьома мультиплікативними сигналами: валідність (чи коректно виконується та оцінює скаффолд?), гранична складність (чи емпіричний рівень успіху моделі близький до цільового показника приблизно в 20 відсотків, чи залишаються завдання складними, але такими, що піддаються навчанню?) і новизна (чи достатньо воно відрізняється від усього, що було в буфері раніше створених завдань?). Оскільки складність вимірюється відповідно до власного поточного рівня успішності моделі, навчальний план автоматично розширюється в міру вдосконалення моделі.

Команда також повідомляє про явні заходи проти злому під час оцінювання: історію git видаляють із зображень сховища, тому моделі не можуть відновити попередні рішення, а доступ до мережі вимкнено, щоб моделі не отримували зовнішні відповіді. Усі результати усереднені за п’ятьма незалежними прогонами.

Числа

Що стосується агентського кодування, кластер результатів флагманської моделі у верхній частині поля з відкритим вихідним кодом. Під час проходження Terminal-Bench 2.1 через джгут Terminus-2 Ornith-1.5-397B 86.1 випереджає Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) і GLM-5.2 (81). У тому ж тесті, що перевіряється через систему Claude Code, Ornith-1.5 показує 85,2 проти Opus 4.8 78,9. На SWE-bench Verified вони фактично порівняні на 86,0 і 85,8, а Kimi K3 трохи попереду на 86,2.

Прогалини збільшуються на складніших пакетах агентів. На DeepSWE Ornith-1.5-397B набирає 56,0 — випереджає GLM-5.2 46,2, хоча поступається Opus 4.8 (59,0) і Kimi K3 (67,5). Найбільш вражаючий стрибок – це покоління: Ornith-1.0 набрав лише 8,0 на DeepSWE, що означає, що нова ітерація забезпечує семикратне покращення того самого сімейства тестів.

Менші моделі розповідають свою історію. Ornith-1.5-35B-A3B, активуючи лише 3B параметри на токен, набирає 68,5 на Terminal-Bench 2.1 (Claude Code) проти 43,4 для Gemma 4-31B від Google і 51,7 для Muse Glimmer-30B від Meta, і публікує 79,0 на SWE-bench Verified. Модель 9B досягає 47,0 на Terminal-Bench 2.1, 70,6 на SWE-bench Verified і 86,4 на GPQA Diamond — цифри, які ставлять модель телефонного класу на вражаючу відстань до конкурентів у настільному класі.

Застереження та контекст

Це контрольні тести, які проводять розробники, а не результати незалежного аудиту, а моделі порівняння були оцінені командою Ornith у її власних налаштуваннях. Конкуруючі лабораторії також налаштовуються на різні компроміси; Керівництво Kimi K3 щодо DeepSWE припускає, що межі роботи з агентським програмним забезпеченням все ще оскаржуються. Але повна прозорість випуску — середні значення за п’ять циклів, опубліковані конфігурації джгутів, розкриті гарантії — робить незалежне відтворення надзвичайно простим.

Реакція громади була значною. Оголошення про випуск привернуло більше ста пунктів на Hacker News за кілька годин, причому обговорення було зосереджено не на твердженнях про контрольні показники, а на методології самовдосконалення, яку кілька коментаторів описали як одну з найбільш надійних відкритих реалізацій генерації завдань у рекурсивному стилі.

Для екосистеми з відкритим вихідним кодом Ornith-1.5 приземляється в той момент, коли відкриті моделі з китайських лабораторій і західних незалежних команд скорочують розрив із закритими кордонами щодо кодування та агентських завдань. Сімейство з ліцензією Массачусетського технологічного інституту, яке відповідає провідній закритій моделі на Terminal-Bench — і постачає готовий для телефону варіант 9B — ще більше звужує цю прогалину, і робить це за допомогою методу навчання, який кожен може перевірити, відтворити та розширити.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →