Ornith チームは、珍しいアイデアに基づいて構築されたオープンウェイト言語モデル ファミリである Ornith-1.5 をリリースしました。モデルは独自のトレーニング タスクを生成し、独自の足場を設計し、継続的に実行されるループでの独自のソリューションの試みから学習します。チーム独自の評価によると、フラッグシップの Or​​nith-1.5-397B は Terminal-Bench 2.1 (Terminus-2) で 86.1 のスコアを獲得し、Anthropic の Claude Opus 4.8 の 85.0 と同等であり、同等のサイズの他のすべてのオープンソース モデルよりも優れています。

MIT ライセンスに基づいて今週 Ornith ブログと Hugging Face で公開されたこのリリースは、フロンティア ラボの予算がなければ不可能だと思われていた結果を定期的に生み出してきたオープンソース AI レースにおける最新の一斉射撃です。 最新の AI モデル ニュース を追跡している開発者や企業にとって、その重要性は 2 つあります。主要なクローズド モデルと同等のベンチマークと、オープン モデル開発が次に向かう方向を示すトレーニング レシピです。

3 つのサイズ、1 つのレシピ

Ornith-1.5 は 3 つの構成で出荷されます。397B パラメータの専門家混合フラッグシップ、トークンごとに 30B パラメータのみをアクティブにする 35B MoE、および iPhone および Android デバイスで直接実行するように設計された量子化された「モバイル」バリアントを備えたコンパクトな 9B 高密度モデルです。 3 つはすべて、GGUF、MLX、および NVFP4 ビルドと並んで Hugging Face で利用可能であり、モデル カードは、このファミリーが Qwen3.5 MoE アーキテクチャに基づいて構築されていることを示しています。

ここで重要なのは血統です。今年初めにリリースされた Ornith-1.0 は、エージェント コーディングへの「自己足場」アプローチを普及させ、静かなヒット作となりました。その 90 億 GGUF ビルドは、Hugging Face で 500 万回以上のダウンロードを記録しました。 Ornith-1.5 は、そのフレームワークをスキャフォールドとロールアウトの最適化から完全な自己改善パイプラインに拡張します。

自己改善ループの説明

従来のトレーニング後のパイプラインでは、人間が厳選した固定のタスクのセットに対して強化学習が実行されます。 Ornith-1.5 では、代わりにモデル自体が新しいタスクを提案し、タスク固有のスキャフォールド (問題を攻撃するために使用される指示、ツール、分解戦略) を生成し、構築したばかりのスキャフォールドによってスコア付けされるソリューションのロールアウトを生成します。報酬は GRPO を使用して 3 つのステージすべてに伝播されるため、システムはより良いタスク、より良い足場、より良いソリューションを作成する方法を同時に学習します。

タスク生成の報酬が設計の中心です。提案された各タスクは、妥当性 (足場が正しく実行および評価されているか)、フロンティアの難易度 (モデルの経験的成功率が約 20% の目標に近く、タスクは困難だが学習可能であるか)、および新規性 (以前に生成されたタスクのバッファー内のすべてのものと十分に異なっているか) の 3 つの乗法シグナルに基づいてスコア付けされます。難易度はモデル自体の現在の成功率に基づいて測定されるため、モデルが向上するにつれてカリキュラムは自動的にエスカレートします。

チームはまた、評価中の明示的なハッキング対策についても報告しています。つまり、モデルが以前のソリューションを復元できないようにリポジトリ イメージから Git 履歴が削除され、モデルが外部の回答を取得できないようにネットワーク アクセスが無効になっています。すべての結果は 5 回の独立した実行の平均です。

数字

エージェント コーディングに関しては、主力製品の自己申告結果がオープンソース分野のトップに群がっています。 Terminus-2 ハーネスを介して実行される Terminal-Bench 2.1 では、Ornith-1.5-397B の 86.1 が、Claude Opus 4.8 (85.0)、DeepSeek-V4-Flash-0731 (82.7)、および GLM-5.2 (81) を上回っています。クロード コード ハーネスを使用した同じベンチマーク実行では、Ornith-1.5 は 85.2 を記録し、Opus 4.8 は 78.9 を記録しました。 SWE ベンチ検証では、両者は 86.0 と 85.8 で実質的に並んでおり、Kimi K3 が 86.2 でわずかに上回っています。

より強力なエージェント スイートでは、その差はさらに広がります。 DeepSWE では、Ornith-1.5-397B のスコアは 56.0 で、GLM-5.2 の 46.2 を上回っていますが、Opus 4.8 (59.0) や Kim K3 (67.5) には及んでいません。最も顕著な変化は世代によるものです。Ornith-1.0 の DeepSWE スコアはわずか 8.0 でした。これは、新しいイテレーションが同じベンチマーク ファミリに対して 7 倍の改善をもたらしたことを意味します。

小さなモデルはそれぞれ独自のストーリーを語ります。 Ornith-1.5-35B-A3B は、トークンごとに 30 億のパラメーターのみをアクティブにし、ターミナルベンチ 2.1 (クロード コード) でスコア 68.5 を獲得しました。これに対し、Google の Gemma 4-31B では 43.4、Meta の Muse Glimmer-30B では 51.7 で、SWE ベンチ Verified では 79.0 を記録しました。 9B モデルは、ターミナルベンチ 2.1 で 47.0、SWE ベンチ検証で 70.6、GPQA ダイヤモンドで 86.4 に達しており、電話クラスのモデルがデスクトップ クラスのライバルに届く範囲にある数字です。

注意事項とコンテキスト

これらは開発者が実行したベンチマークであり、独自に監査された結果ではありません。比較モデルは Ornith チームが独自のハーネス設定に基づいて評価したものです。ライバルの研究所もさまざまなトレードオフに合わせて調整しています。 DeepSWE における Kim K3 のリードは、エージェント ソフトウェア作業のフロンティアが依然として争われていることを示唆しています。しかし、このリリースの全表の透明性 (5 回の実行平均、公開されたハーネス構成、公開された安全対策) により、独立した複製が非常に簡単になります。

コミュニティの反応はかなりのものでした。このリリースの発表は数時間以内に Hacker News で 100 ポイントをはるかに超えるポイントを集め、議論はベンチマークの主張よりも自己改善の方法論に焦点が当てられ、何人かのコメント投稿者は再帰的スタイルのタスク生成のより信頼できるオープンな実装の 1 つであると述べました。

オープンソース エコシステムの場合、Ornith-1.5 は、中国の研究所や西側の独立チームのオープン モデルが、コーディングやエージェント タスクに関する閉ざされたフロンティアとのギャップを埋めつつある時期に登場します。 Terminal-Bench の主要なクローズド モデルと一致し、電話対応の 9B バリアントを出荷する MIT ライセンス ファミリは、そのギャップをさらに狭め、誰でも検査、再現、拡張できるトレーニング方法でそれを実現します。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→