Ornith 팀은 특이한 아이디어를 기반으로 구축된 개방형 언어 모델 제품군인 Ornith-1.5를 출시했습니다. 모델은 자체 교육 작업을 생성하고 자체 스캐폴드를 설계하며 지속적으로 실행되는 루프에서 자체 솔루션 시도를 통해 학습합니다. 팀의 자체 평가에 따르면 주력 제품인 Ornith-1.5-397B는 Terminal-Bench 2.1(Terminus-2)에서 86.1점을 획득하여 Anthropic의 Claude Opus 4.8과 동등한 85.0점을 기록했으며 비슷한 크기의 다른 모든 오픈 소스 모델보다 앞서 있습니다.
이번 주 Ornith 블로그와 MIT 라이센스에 따라 Hugging Face에 게시된 이 릴리스는 한때 개척 연구소의 예산 없이는 불가능하다고 생각되었던 결과를 정기적으로 생산해 온 오픈 소스 AI 경쟁의 최신 일격입니다. 최신 AI 모델 뉴스를 추적하는 개발자와 기업에게 중요한 것은 두 가지입니다. 선도적인 폐쇄형 모델과의 벤치마크 패리티와 개방형 모델 개발이 다음 방향을 가리키는 훈련 레시피입니다.
세 가지 크기, 하나의 레시피
Ornith-1.5는 397B 매개변수 혼합 전문가 플래그십, 토큰당 3B 매개변수만 활성화하는 35B MoE, iPhone 및 Android 장치에서 직접 실행하도록 설계된 양자화된 "모바일" 변형을 갖춘 소형 9B 밀도 모델의 세 가지 구성으로 제공됩니다. 세 가지 모두 GGUF, MLX 및 NVFP4 빌드와 함께 Hugging Face에서 사용할 수 있으며 모델 카드에는 제품군이 Qwen3.5 MoE 아키텍처를 기반으로 구축되었음을 나타냅니다.
여기서 혈통이 중요합니다. 올해 초 출시된 Ornith-1.0은 에이전트 코딩에 대한 "자체 스캐폴딩" 접근 방식을 대중화했으며 조용한 인기를 얻었습니다. 9B GGUF 빌드는 Hugging Face에서 5백만 건 이상의 다운로드를 기록했습니다. Ornith-1.5는 해당 프레임워크를 스캐폴드 및 롤아웃 최적화에서 완전한 자체 개선 파이프라인으로 확장합니다.
자기 개선 루프, 설명
기존의 훈련 후 파이프라인에서 강화 학습은 인간이 선별한 고정된 작업 세트에 대해 실행됩니다. 대신 Ornith-1.5는 모델 자체가 새로운 작업을 제안하고 작업별 비계(문제를 공격하는 데 사용되는 지침, 도구 및 분해 전략)를 생성한 다음 방금 구축한 비계에 의해 점수가 매겨지는 솔루션 롤아웃을 생성합니다. 보상은 GRPO를 사용하여 세 단계 모두를 통해 다시 전파되므로 시스템은 더 나은 작업, 더 나은 스캐폴드 및 더 나은 솔루션을 작성하는 방법을 동시에 학습합니다.
작업 생성 보상은 디자인의 핵심입니다. 제안된 각 작업은 타당성(스캐폴드가 올바르게 실행되고 평가됩니까?), 프론티어 난이도(모델의 경험적 성공률이 대략 20% 목표에 가까우며 작업을 도전적이면서도 학습 가능한 상태로 유지합니까?), 참신함(이전에 생성된 작업 버퍼에 있는 모든 것과 충분히 다른가요?)의 세 가지 곱셈 신호에 따라 점수가 매겨집니다. 난이도는 모델 자체의 현재 성공률을 기준으로 측정되므로 모델이 향상되면 커리큘럼이 자동으로 확대됩니다.
또한 팀은 평가 중에 명시적인 해킹 방지 조치를 보고합니다. git 기록은 저장소 이미지에서 제거되므로 모델이 이전 솔루션을 복구할 수 없으며, 모델이 외부 답변을 가져오는 것을 방지하기 위해 네트워크 액세스가 비활성화됩니다. 모든 결과는 5번의 독립적인 실행에 대한 평균입니다.
숫자
에이전트 코딩에서 플래그십의 자체 보고 결과는 오픈 소스 필드의 상단에 클러스터됩니다. Terminal-Bench 2.1에서 Terminus-2 하네스를 통과하여 Ornith-1.5-397B의 86.1 가장자리가 Claude Opus 4.8(85.0), DeepSeek-V4-Flash-0731(82.7) 및 GLM-5.2(81) 밖으로 나옵니다. Claude Code 하네스를 통해 실행된 동일한 벤치마크에서 Ornith-1.5는 Opus 4.8의 78.9에 비해 85.2를 기록했습니다. SWE-bench Verified에서 두 선수는 86.0과 85.8로 사실상 동률을 이루었으며 Kimi K3는 86.2로 약간 앞섰습니다.
더 단단한 에이전트 제품군에서는 격차가 넓어집니다. DeepSWE에서 Ornith-1.5-397B는 56.0점을 기록했습니다. 이는 GLM-5.2의 46.2점보다 앞서지만 Opus 4.8(59.0) 및 Kimi K3(67.5)보다 뒤처져 있습니다. 가장 눈에 띄는 점프는 세대 간 향상입니다. Ornith-1.0은 DeepSWE에서 8.0점을 얻었습니다. 이는 새로운 반복이 동일한 벤치마크 제품군에서 7배 향상된 성능을 제공한다는 의미입니다.
작은 모델은 자신만의 이야기를 전합니다. 토큰당 3B 매개변수만 활성화하는 Ornith-1.5-35B-A3B는 Terminal-Bench 2.1(Claude Code)에서 68.5점을 얻었고 Google의 Gemma 4-31B에서는 43.4점, Meta의 Muse Glimmer-30B에서는 51.7점을 얻었으며 SWE-bench Verified에서는 79.0점을 기록했습니다. 9B 모델은 Terminal-Bench 2.1에서 47.0, SWE-bench Verified에서 70.6, GPQA Diamond에서 86.4에 도달합니다. 이는 전화급 모델을 데스크탑급 경쟁 제품과 비교할 수 없는 거리에 두는 수치입니다.
주의사항 및 상황
이는 독립적으로 감사된 결과가 아닌 개발자가 실행하는 벤치마크이며, 비교 모델은 Ornith 팀이 자체 하네스 설정에 따라 평가했습니다. 경쟁 연구실은 또한 다양한 장단점을 조정합니다. DeepSWE에 대한 Kimi K3의 리드는 에이전트 소프트웨어 작업의 한계가 여전히 논쟁의 여지가 있음을 시사합니다. 그러나 릴리스의 전체 테이블 투명성(5회 평균, 게시된 하네스 구성, 공개된 보호 장치) 덕분에 독립적인 재생산이 매우 간단해졌습니다.
커뮤니티의 반응은 상당했습니다. 릴리스 발표는 몇 시간 만에 Hacker News에서 100개 이상의 포인트를 끌어냈으며, 토론은 벤치마크 주장보다는 자체 개선 방법론에 초점을 맞추었습니다. 여러 논평자들은 이를 재귀 스타일 작업 생성의 보다 신뢰할 수 있는 개방형 구현 중 하나로 설명했습니다.
오픈 소스 생태계의 경우 Ornith-1.5는 중국 연구실과 서구 독립 팀의 개방형 모델이 코딩 및 에이전트 작업에 대한 폐쇄적 경계와의 격차를 좁히고 있는 순간에 출시되었습니다. Terminal-Bench의 주요 폐쇄형 모델과 일치하고 전화 지원 9B 변형을 배송하는 MIT 라이선스 제품군은 이러한 격차를 더욱 줄이고 누구나 검사, 재생산 및 확장할 수 있는 교육 방법을 사용하여 이를 수행합니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →