Devin AI yazılım mühendisinin arkasındaki şirket olan Cognition, Perşembe günü SWE-2'yi piyasaya sürdü ve bunu şimdiye kadarki en gelişmiş kodlama modeli olarak tanımladı. 10 Eylül'de yayınlanan bir blog yazısında şirket, yeni modelin Pareto yetenek ve maliyet sınırını zorladığını, FrontierCode 1.1 Ana kriterinde %50,0 puan alırken, %50,9 ile kendisinden sadece bir puan önde olan Antropik model olan Fable 5.1'den %64 daha düşük maliyete sahip olduğunu söyledi.

Lansman, Cognition'ın 48 milyar dolarlık bir değerlemeyle 2 milyar dolarlık bir finansman turunu onaylamasından ancak bir gün sonra gerçekleşti ve bu, ajansal kodlama girişiminin yalnızca üçüncü taraf sınır modellerine güvenmek yerine kendi model geliştirmeye ne kadar agresif bir şekilde yatırım yaptığını gösteriyor. Yapay zeka kodlama yarışının ve sektörü harekete geçiren diğer her şeyin sürekli kapsamı için, son dakika yapay zeka haberlerine yönelik günlük kaynağınız olan AI Buzz Wire'a yer işareti koyun.

SWE-2'nin Karşılaştırmalı Değerlerde Bulunduğu Yer

Cognition'ın yayınlanan sonuçlarına göre SWE-2, FrontierCode 1.1 Main'de %50,0 puan alırken, %48,0 puanla Grok 4,6'nın ve %47,5 puanla GPT-5,6 Sol'un önünde yer alıyor ve %53,3 ile alanda lider olan GPT-6 Astra'nın çarpıcı mesafesi içinde yer alıyor. DeepSWE 1.1 kıyaslamasında SWE-2 %73,0'a ulaşarak Cognition modelleri arasında Astra'nın %74,1'inden sonra ikinci sırada yer alıyor.

En güçlü performans, SWE-2'nin %92,8 puan aldığı Terminal-Bench 2.1'de geliyor; Cognition'ın karşılaştırma tablosundaki en yüksek rakam, %91,4 ile Fable 5.1 ve %89,9 ile GPT-6 Astra'nın önünde. SWE-2'nin GPT-6 Astra için %57,9'a ve Fable 5.1 için %55,8'e karşılık %27,3'ü yönettiği daha zorlu Terminal-Bench 4'te resim değişiyor; bu, modelin verimlilik öncelikli tasarımının görev zorluğunun en üst noktasında boşluk bıraktığını hatırlatıyor.

Cognition, konumlandırmayı açık bir şekilde özetliyor: SWE-2, FrontierCode 1.1 Main ve DeepSWE 1.1'de önceki modeli SWE-1.7 ve Grok 4.6'yı hem puan hem de maliyet açısından geride bırakıyor, fiyatlarının çok altında GPT-5.6 Sol ve Fable 5/5.1 ile eşleşiyor ve GPT-6 Astra'ya dörtte bir maliyetle birkaç puan yaklaşıyor.

Kimi K3'ten Multi Trilyon Ölçekte Sonradan Eğitim Alındı

SWE-2 sıfırdan oluşturulmamıştır. Cognition, Moonshot AI'nin 2,8 trilyon parametreli temel modeli olan Kimi K3'ün modeline sonradan eğitim verdi ve bu model, ajansal kodlama için halihazırda kapsamlı pekiştirmeli öğrenimden geçmişti. Cognition, bu temelin ötesinde, RL sürecinin birçok kıyaslamada beş ila altı puan eklediğini ve K3'ün tüm maliyet-performans sınırını değiştirdiğini söylüyor.

Şirket, SWE-2'nin, SWE-1.7 için geliştirilen eğitim altyapısı ve tarifini temel alarak takviyeli öğrenmeyi multi-trilyon parametreli rejime ölçeklendirdiği ilk sefer olduğunu söylüyor. Önemli ekleme, düşük, orta ve yüksek eforu ayrı eğitim hedefleri olarak ele almak yerine, tüm akıl yürütme eforu seviyelerini tek bir çalıştırmada eğiten bir RL algoritmasıdır.

Maliyet Cezaları Tüm Sınırı Şekillendiriyor

SWE-2'nin eğitimindeki temel fikir, her bir cezanın temel modelin Pareto sınırının yerel eğimine göre ayarlandığı, tek bir RL koşusu içindeki çaba düzeyi başına uygulanan doğrusal bir maliyet cezasıdır. Cognition, ilk ilkelerden türetilen bu yaklaşımın, modelin tüm maliyet-performans sınırını geliştirirken şeklini koruduğunu ve gerçek kullanıcı maliyetlerini eğitime mümkün olduğunca doğrudan yansıttığını söylüyor.

Şirket ayrıca, SWE-1.6'dan bu yana kullandığı uzunluk ağırlıklı bir ödül temel çizgisini de ayrıntılı olarak açıkladı; bu, önemli ölçüde istikrar kazandıran eğitimin yanı sıra, kod çözme verimini artırmak için çevrimiçi bir taslak modeli içeren RL kullanıma sunma hizmetinde yapılan iyileştirmelere de güveniyor. Cognition, NVFP4 ve FP8 çekirdekleri ve nicelemeye duyarlı eğitim sayesinde, temel modelin önceki modelin neredeyse üç katı parametrelere sahip olmasına rağmen genel bellek kullanımını azalttığını söylüyor.

Eğitim verileri hattı da genişledi: Cognition, RL ortamlarının sayısını üç katına çıkardı, talimatları takip eden katmanlar ekledi ve modeli puanlamak için kullanılan doğrulayıcıları yinelemeli olarak güçlendiren önceki SWE-2 kontrol noktaları tarafından desteklenen bir volan oluşturdu.

Zeka Kadar Verimlilik

Biliş, SWE-2'nin kazanımlarını verimliliğe yakından bağlı olarak çerçeveliyor. Şirket, daha güçlü mühendislik yargısının, temsilcinin daha az sapma ve gereksiz okumayla daha eksiksiz çözümler yazmasına olanak tanıdığını söylüyor. FrontierCode 1.1 Main'de, SWE-2'nin orta eforlu konfigürasyonu SWE-1.7'den daha yüksek puan alırken %58 daha az dönüş alır ve %81 daha az maliyetlidir.

Bu çerçeveleme Cognition'ın işi açısından önemlidir. Devin, özerk bir yazılım mühendisi olarak satılıyor ve çıkarım maliyeti, fiyatlandırma ve marjlara doğrudan bir girdi. Görev başına dönüşleri ve jetonları azaltırken sınıra yakın kaliteyi koruyan bir model, şirketin hizmet verdiği her Devin oturumunun ekonomisini değiştiriyor.

Kullanılabilirlik

Şirkete göre SWE-2 bugünden itibaren Devin Desktop ve Devin CLI'de mevcut olup Devin Web ve Fusion'da da kullanıma sunulması planlanıyor. Cognition, kullanıcıların modelin önümüzdeki günlerde yüzeylerde göründüğünü görmesi gerektiğini söylüyor.

Kodlama Modeli Pazarı İçin Ne İfade Ediyor?

Sürüm, GPT-6 Astra'nın arkasında zaten kalabalık olan paketi daha da sıkılaştırıyor. Cognition artık Anthropic, OpenAI ve xAI tekliflerini önemli ölçüde daha düşük maliyetle takas eden bir modele sahip ve modelden temsilci ürününe kadar tüm yığını kontrol ediyor. Rakipler, özellikle SWE-2'nin maliyet profilinin en güçlü olduğu yüksek hacimli, orta zorluktaki görevlerde, yetenek kadar fiyat konusunda da yanıt verme baskısıyla karşı karşıya kalacak.

Yapay zeka kodlama araçlarının alıcıları için pratik çıkarım, sınır düzeyinde kodlama yardımının artık sınır düzeyinde fiyatlandırma gerektirmemesidir. Sektörün geri kalanı için SWE-2, yalnızca temel model ölçeğinin değil, eğitim sonrası ve altyapı verimliliğinin de belirleyici bir rekabet aracı haline geldiğinin kanıtıdır.

---

Yapay Zekanın Önünde Olun

En son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.

Daha fazla AI haberini okuyun →