Команда Ornith выпустила Ornith-1.5, семейство языковых моделей с открытым весом, построенных на необычной идее: модель генерирует свои собственные обучающие задачи, разрабатывает собственные каркасы и учится на собственных попытках решения в непрерывном цикле. По собственным оценкам команды, флагманский Ornith-1.5-397B набрал 86,1 балла на Terminal-Bench 2.1 (Terminus-2), что ставит его на один уровень с Claude Opus 4.8 от Anthropic с результатом 85,0 и опережает любую другую модель с открытым исходным кодом сопоставимого размера.

Релиз, опубликованный на этой неделе в блоге Ornith и Hugging Face под лицензией MIT, является последним залпом в гонке ИИ с открытым исходным кодом, которая регулярно дает результаты, которые раньше считались невозможными без бюджета передовой лаборатории. Для разработчиков и предприятий, отслеживающих [последние новости о моделях искусственного интеллекта] (https://aibuzzwire.news), это имеет двоякое значение: равенство эталонных показателей с ведущей закрытой моделью и рецепт обучения, который указывает, в каком направлении будет двигаться развитие открытой модели.

Три размера, один рецепт

Ornith-1.5 поставляется в трех конфигурациях: флагманская смесь экспертов с 397B параметрами, MoE с 35B, которая активирует только 3B параметров на токен, и компактная модель с плотностью 9B с квантованным «мобильным» вариантом, предназначенная для работы непосредственно на устройствах iPhone и Android. Все три доступны на Hugging Face вместе со сборками GGUF, MLX и NVFP4, а на карточках моделей указано, что семейство построено на архитектуре Qwen3.5 MoE.

Родословная здесь имеет значение. Ornith-1.0, выпущенный ранее в этом году, популяризировал подход к агентному кодированию с использованием «самостоятельных лесов» и стал тихим хитом — его сборка 9B GGUF получила более пяти миллионов загрузок на Hugging Face. Ornith-1.5 расширяет эту структуру от оптимизации каркасов и развертываний до полноценного конвейера самосовершенствования.

Объяснение цикла самосовершенствования

В обычном конвейере постобучения обучение с подкреплением выполняется с фиксированным набором задач, курируемых человеком. Вместо этого в Ornith-1.5 сама модель предлагает новые задачи, генерирует каркас для конкретной задачи — инструкции, инструменты и стратегию декомпозиции, используемые для решения проблемы, — а затем создает развертывание решений, которые оцениваются только что построенным каркасом. Вознаграждение распространяется обратно на все три этапа с помощью GRPO, поэтому система одновременно учится писать лучшие задачи, лучшие схемы и лучшие решения.

Награда за создание задач — это сердце проекта. Каждая предлагаемая задача оценивается по трем мультипликативным сигналам: достоверность (правильно ли работает и оценивается платформа?), пограничная сложность (близок ли эмпирический показатель успешности модели к целевому значению примерно в 20 процентов, сохраняя задачи сложными, но выполнимыми?) и новизна (достаточно ли она отличается от всего, что находится в буфере ранее сгенерированных задач?). Поскольку сложность измеряется с учетом текущего уровня успеха модели, учебная программа автоматически расширяется по мере совершенствования модели.

Команда также сообщает о явных мерах по борьбе с хакерством во время оценки: история git удаляется из образов репозитория, поэтому модели не могут восстановить предыдущие решения, а доступ к сети отключен, чтобы модели не могли получать внешние ответы. Все результаты усреднены по пяти независимым запускам.

Числа

При агентном кодировании результаты, сообщаемые флагманом, располагаются в верхней части поля с открытым исходным кодом. На Terminal-Bench 2.1, проходящем через обвязку Терминуса-2, 86.1 Орнит-1.5-397B опережает Claude Opus 4.8 (85,0), DeepSeek-V4-Flash-0731 (82,7) и GLM-5.2 (81). В том же тесте с использованием системы Claude Code Ornith-1.5 показывает 85,2 против 78,9 у Opus 4.8. На SWE-bench Verified эти двое фактически имеют равные показатели - 86,0 и 85,8, а Кими К3 немного опережает - 86,2.

Разрыв увеличивается в более сложных агентских комплектах. На DeepSWE Ornith-1.5-397B набрал 56,0 баллов, что опережает GLM-5.2 с 46,2 балла, но уступает Opus 4,8 (59,0) и Kimi K3 (67,5). Самый поразительный скачок связан с поколениями: Ornith-1.0 набрал всего 8,0 баллов на DeepSWE, а это означает, что новая итерация обеспечивает семикратное улучшение по сравнению с тем же семейством тестов.

Меньшие модели рассказывают свою собственную историю. Ornith-1.5-35B-A3B, активирующий только 3B параметров на токен, набирает 68,5 баллов на Terminal-Bench 2.1 (Claude Code) против 43,4 для Google Gemma 4-31B и 51,7 для Meta's Muse Glimmer-30B и показывает 79,0 баллов на SWE-bench Verified. Модель 9B достигает 47,0 на Terminal-Bench 2.1, 70,6 на SWE-bench Verified и 86,4 на GPQA Diamond — цифры, которые ставят модель класса телефона на расстояние досягаемости конкурентов настольного класса.

Предостережения и контекст

Это тесты, проводимые разработчиками, а не результаты независимого аудита, и сравнительные модели оценивались командой Ornith с собственными настройками системы. Конкурирующие лаборатории также настраиваются на различные компромиссы; Руководитель Кими К3 по DeepSWE предполагает, что границы разработки агентного программного обеспечения все еще оспариваются. Но полная прозрачность таблицы — средние значения за пять запусков, опубликованные конфигурации подвески, раскрытые меры безопасности — делает независимое воспроизведение необычайно простым.

Реакция сообщества была существенной. Объявление о выпуске за считанные часы привлекло более ста баллов на Hacker News, при этом обсуждение было сосредоточено не столько на утверждениях об эталонных тестах, сколько на методологии самосовершенствования, которую некоторые комментаторы описали как одну из наиболее заслуживающих доверия открытых реализаций генерации задач в рекурсивном стиле.

Что касается экосистемы с открытым исходным кодом, Ornith-1.5 появляется в тот момент, когда открытые модели из лабораторий Китая и независимых западных команд сокращают разрыв с закрытыми границами в области кодирования и агентских задач. Семейство, лицензированное MIT, которое соответствует ведущей закрытой модели Terminal-Bench и поставляет готовый к использованию на телефоне вариант 9B, еще больше сокращает этот разрыв и делает это с помощью метода обучения, который каждый может проверить, воспроизвести и расширить.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →