Ornith ekibi, sıra dışı bir fikir etrafında inşa edilmiş bir açık ağırlıklı dil modelleri ailesi olan Ornith-1.5'i piyasaya sürdü: model kendi eğitim görevlerini üretiyor, kendi iskelelerini tasarlıyor ve sürekli çalışan bir döngüde kendi çözüm girişimlerinden öğreniyor. Ekibin kendi değerlendirmelerine göre amiral gemisi Ornith-1.5-397B, Terminal-Bench 2.1'de (Terminus-2) 86,1 puan alarak, 85,0 puanla Anthropic'in Claude Opus 4.8'iyle aynı seviyeye geliyor ve karşılaştırılabilir boyuttaki diğer tüm açık kaynaklı modellerin önüne geçiyor.

Bu hafta Ornith blogunda ve MIT lisansı altında Hugging Face'te yayınlanan sürüm, bir zamanlar öncü laboratuvar bütçesi olmadan imkansız olduğu düşünülen sonuçları düzenli olarak üreten açık kaynak yapay zeka yarışındaki en son salvodur. En son yapay zeka modeli haberlerini takip eden geliştiriciler ve kuruluşlar için bunun önemi iki yönlüdür: önde gelen kapalı modelle kıyaslama eşitliği ve açık model geliştirmenin bundan sonra nereye gideceğini gösteren bir eğitim tarifi.

Üç Boyut, Tek Tarif

Ornith-1.5 üç konfigürasyonda gönderilir: 397B parametreli uzmanlardan oluşan bir amiral gemisi, token başına yalnızca 3B parametreyi etkinleştiren bir 35B MoE ve doğrudan iPhone ve Android cihazlarda çalışmak üzere tasarlanmış sayısallaştırılmış bir "Mobil" değişkene sahip kompakt 9B yoğun model. Üçü de Hugging Face'te GGUF, MLX ve NVFP4 yapılarının yanı sıra mevcut ve model kartları, ailenin Qwen3.5 MoE mimarisi üzerine kurulduğunu gösteriyor.

Burada soy önemli. Bu yılın başlarında piyasaya sürülen Ornith-1.0, ajansal kodlamada "kendi kendine iskele" yaklaşımını popüler hale getirdi ve sessiz bir hit haline geldi; 9B GGUF yapısı Hugging Face'te beş milyondan fazla indirme kaydetti. Ornith-1.5, bu çerçeveyi iskelelerin optimize edilmesinden ve kullanıma sunulmasından tam bir kişisel gelişim hattına kadar genişletiyor.

Kişisel Gelişim Döngüsü, Açıklanıyor

Geleneksel bir eğitim sonrası ardışık düzende, takviyeli öğrenme, insanların hazırladığı sabit bir dizi göreve karşı çalışır. Ornith-1.5 bunun yerine modelin kendisinin yeni görevler önermesini, göreve özgü bir iskele (soruna saldırmak için kullanılan talimatlar, araçlar ve ayrıştırma stratejisi) oluşturmasını ve ardından yeni oluşturduğu iskele tarafından puanlanan çözüm sunumları üretmesini sağlıyor. Ödül, GRPO kullanılarak her üç aşamaya da dağıtılır, böylece sistem aynı anda daha iyi görevler, daha iyi iskeleler ve daha iyi çözümler yazmayı öğrenir.

Görev oluşturma ödülü tasarımın kalbidir. Önerilen her görev üç çarpımsal sinyale göre puanlanır: geçerlilik (iskele doğru şekilde yürütülüyor ve değerlendiriliyor mu?), sınır zorluğu (modelin ampirik başarı oranı yaklaşık yüzde 20'lik bir hedefe yakın mı, görevleri zorlu ama öğrenilebilir tutuyor mu?) ve yenilik (önceden oluşturulmuş görevlerin arabelleğindeki her şeyden yeterince farklı mı?). Zorluk, modelin kendi mevcut başarı oranına göre ölçüldüğü için, model geliştikçe müfredat da otomatik olarak yükseltilir.

Ekip ayrıca değerlendirme sırasında açık bir şekilde bilgisayar korsanlığına karşı önlemlerin alındığını da bildirdi: Git geçmişi, depo görüntülerinden çıkarılarak modellerin önceki çözümleri kurtaramaması ve modellerin harici yanıtlar getirmesini önlemek için ağ erişiminin devre dışı bırakılması. Tüm sonuçların beş bağımsız çalışmanın ortalaması alınır.

Sayılar

Ajansal kodlamada, amiral gemisinin kendi bildirdiği sonuçlar açık kaynak alanının en üstünde kümeleniyor. Terminal-Bench 2.1'de, Terminus-2 kablo demetinden geçen Ornith-1.5-397B'nin 86.1'i, Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) ve GLM-5.2'yi (81) geride bırakıyor. Claude Code donanımıyla yapılan aynı kıyaslamada Ornith-1.5, Opus 4.8'in 78.9'una karşılık 85.2 puan alıyor. SWE-bench Verified'da ikisi 86,0 ve 85,8 puanla etkili bir şekilde berabere kalırken Kimi K3 86,2 puanla biraz önde.

Daha sert ajan süitlerinde boşluklar genişliyor. DeepSWE'de Ornith-1.5-397B 56,0 puanla GLM-5.2'nin 46,2 önünde, ancak Opus 4,8 (59,0) ve Kimi K3'ün (67,5) gerisinde bulunuyor. En çarpıcı sıçrama nesilseldir: Ornith-1.0, DeepSWE'de yalnızca 8,0 puan aldı, bu da yeni yinelemenin aynı kıyaslama ailesinde yedi kat iyileşme sağladığı anlamına geliyor.

Küçük modeller kendi hikayelerini anlatıyor. Token başına yalnızca 3B parametresini etkinleştiren Ornith-1.5-35B-A3B, Terminal-Bench 2.1'de (Claude Code) 68,5 puan alırken, Google'ın Gemma 4-31B'sinde 43,4 ve Meta'nın Muse Glimmer-30B'sinde 51,7 puan aldı ve SWE-bench Verified'da 79,0 puan aldı. 9B modeli, Terminal-Bench 2.1'de 47,0'a, SWE-bench Verified'da 70,6'ya ve GPQA Diamond'da 86,4'e ulaşıyor; bu rakamlar, telefon sınıfı bir modeli, masaüstü sınıfı rakiplerinin çok yakınına yerleştiriyor.

Uyarılar ve Bağlam

Bunlar geliştirici tarafından yürütülen kıyaslamalardır, bağımsız olarak denetlenen sonuçlar değildir ve karşılaştırma modelleri Ornith ekibi tarafından kendi donanım ayarları altında değerlendirilmiştir. Rakip laboratuvarlar aynı zamanda farklı değiş tokuşlara da uyum sağlıyor; Kimi K3'ün DeepSWE konusundaki liderliği, ajansal yazılım çalışmalarının sınırlarının hala tartışmalı olduğunu gösteriyor. Ancak sürümün tam tablo şeffaflığı (beş çalıştırmalı ortalamalar, yayınlanmış donanım konfigürasyonları, açıklanan güvenlik önlemleri) bağımsız çoğaltmayı alışılmadık derecede basit hale getiriyor.

Toplumun tepkisi oldukça büyük oldu. Yayın duyurusu birkaç saat içinde Hacker News'te yüzden fazla puan aldı; tartışma, referans iddialardan çok, birçok yorumcunun özyinelemeli görev oluşturmanın daha güvenilir açık uygulamalarından biri olarak tanımladığı kişisel gelişim metodolojisine odaklandı.

Açık kaynak ekosistemi için Ornith-1.5, Çin laboratuvarlarından ve Batılı bağımsız ekiplerden gelen açık modellerin kodlama ve ajan görevlerinde kapalı sınırlarla aradaki farkı kapattığı bir zamanda ortaya çıktı. Terminal-Bench'teki önde gelen kapalı modellerden birine uyan ve telefona hazır bir 9B varyantı gönderen MIT lisanslı bir aile, bu boşluğu daha da daraltıyor ve bunu herkesin inceleyebileceği, çoğaltabileceği ve genişletebileceği bir eğitim yöntemiyle yapıyor.

---

Yapay Zekanın Önünde Olun

En son yapay zeka haberlerini, analizlerini ve buluşlarını tek bir yerden alın.

Daha fazla AI haberini okuyun →