Eski bir OpenAI araştırmacısı tarafından kurulan yeni bir yapay zeka girişimi, tamamen yeni bir model sınıfı olarak adlandırdığı şeyi başlattı; size bir makale yazamayan ve asıl amacın bu olduğunu söyleyen bir model.
TypeSafe AI Salı günü, Jev adlı ilk "System One Model"in hemen erken erişime sunulduğunu duyurdu. Şirket, ChatGPT'nin talimat takibinin ardındaki araştırmanın OpenAI'de katkıda bulunduğu çalışmalardan kaynaklandığını söyleyen Diogo Almeida tarafından kuruldu. İki yıl boyunca gizlilikten sonra, endüstrinin sohbete olan takıntısının otomasyonun gerçekte nerede başarısız olduğunu gizlediğini savunuyor. For more context on this story, see our ongoing more AI stories.
"Modeller yıllardır sohbette insanüstü şeyler yapıyorlar, peki otomasyon nerede?" Almeida lansman gönderisinde şunu yazdı: "Son dört yıldır beni yönlendiren soru bu oldu."
'Birinci Sistem' Modeli Aslında Nedir?
Bu isim, psikolojinin hızlı, içgüdüsel düşünme ile yavaş, kasıtlı akıl yürütme arasındaki ayrımından gelmektedir. Büyük dil modellerinin simge bazında metin belirteci ürettiği (esnek, genel ve ara sıra kendinden emin saçmalıklara eğilimli) TypeSafe'in Jev'i daha dar bir şey yapmak için tasarlanmıştır: yapılandırılmamış durumu girdi olarak alın ve kalibre edilmiş olasılıkların eklendiği yazılı, yapılandırılmış kararları döndürün.
Şirket, Jev'i "sınır istihbaratı işlev çağrısı: yapılandırılmamış durum içeri, yazılı olasılıksal kararlar dışarı" olarak tanımlıyor. Olası çıktılar önceden tanımlandığı ve model hiçbir zaman serbest biçimli dizeler üretmediği için TypeSafe, tür hataları üretemeyeceğini (şirketin söylediğine göre bu özellik istatistiksel olarak muhtemel olmaktan ziyade matematiksel olarak garanti ediliyor) ve metin üreten modellerin yaptığı gibi halüsinasyon göremediğini iddia ediyor.
Lansman gönderisine göre mimari, ana akım uygulamadan üç şekilde ayrılıyor: yeni bir model mimarisi, tüm çıktıları sıralı olarak değil tek bir sorguda üreten paralel bir örnekleyici ve şirketin, insan tercihi veya programatik olarak doğrulanabilir çıktılar yerine epistemik olarak dürüst olasılıkları optimize eden, Kalibre Edilmiş Kararlar için Güçlendirme Öğrenme (RLCD) adını verdiği bir eğitim yöntemi.
İddialar: 100 Kat Daha Hızlı, Maliyetin Çok Küçük Bir Kısmı
TypeSafe'in yayınladığı rakamlar oldukça agresif. Şirket, Jev'in "Sistem Bir şekilli" olarak adlandırdığı görevlerde (sınıflandırma, yönlendirme, puanlama, çıkarma ve dallanma kararları) mevcut sınır LLM'leriyle karşılaştırılabilir zeka sağladığını ve sınır modellerinin uçtan uca yanıt sürelerine karşılık 3 ila 329 saniyelik uçtan uca yanıt sürelerine karşılık 70 ila 500 milisaniyede yanıt verdiğini söylüyor. Şirket, bunun 40 ila 200 kat daha hızlı sonuç verdiğini söylüyor.
Fiyatlandırma da benzer şekilde alışılmışın dışında: Çıkışlar jeton bazında üretilmek yerine paralel olarak hesaplandığından, çıktı jetonları ücretsiz olarak bir milyon giriş jetonu başına 0,042 dolar. Şirket, gönderisinde fiyatlandırmanın belirli ölçekte sürdürülebilir olduğunu henüz kanıtlayamayacağını kabul etti.
Gönderide, sahip olduğu kanıtları sunmadan önce "Olağanüstü iddialar olağanüstü kanıtlar gerektirir" ifadesi yer alıyor.
Makbuzlar — ve Şüpheciler Ne Diyor?
TypeSafe, Jev'i benzer zekaya sahip en karşılaştırılabilir sınır modeli olarak tanımladığı GPT-5.6 Terra ile karşılaştıran yan yana bir demo yayınladı ve kaydedilen çalışmadaki tek anlaşmazlığın gerçekten belirsiz bir karar çağrısı içerdiğini söyledi. Ayrıca, sabit bir hesaplama grafiği içinde modelleri en büyük harici modellerin (OpenAI's Astra ve Anthropic's Fable) fikir birliğine göre ölçen yeni bir "iş akışı değerlendirme" metodolojisini tanıttı ve Jev'in "neredeyse 2 büyüklük düzeyinde Pareto sınırına sahip olduğunu" iddia etti.
Özellikle şirket, yazılım iş akışları içindeki yapılandırılmış kararlar için tasarlanmış bir modelin anlamlı küresel karşılaştırmaya direndiğini savunarak neden geleneksel kıyaslamalardan kaçındığını açıklayan "antibenchmaxxing" başlıklı bir yazı yayınladı.
Lansmanın saatler içinde yüzlerce puan topladığı Hacker News'e verilen tepkiler, gerçek heyecandan keskin şüpheciliğe kadar uzanıyordu. Bazı yorumcular, kamuya açık kanıtların, tekrarlanabilir üçüncü taraf değerlendirmelerinden ziyade büyük ölçüde demo videolardan (Doom oyun döngüsünü destekleyen modeli gösteren bir video da dahil) oluştuğunu belirtti. Diğerleri, yaklaşımın en iyi şekilde, LLM'lerin yerini almaktan ziyade bir iş yükü dilimi için yararlı, son derece hızlı, sınır kalitesinde bir sınıflandırıcı olarak anlaşıldığını savundu.
Sempatik gözlemciler bile ispat yükünü açıkça çerçevelediler. Bir yorumcu, "Evet, şüpheci gibi konuşuyorlar ama birkaç demo videosu dışında çok fazla kanıt sunmuyorlar" diye yazdı. "Canlı bir demo çok daha ikna edici olurdu."
Neden Önemli Olabilir?
Saha gerçek bir acı noktasına iniyor. Ticari yazılımdaki üretim LLM çağrılarının büyük bir kısmı hiçbir şekilde üretken değildir; bunlar ikili değerlendirmeler, kategori atamaları ve düzyazıya sarılmış yönlendirme kararlarıdır. Bir model, bu çağrıları kalibre edilmiş bir güvenle 70 milisaniyede ve etkili bir şekilde sıfır çıkış maliyetiyle yapabilirse, yapay zeka destekli yazılımın ekonomisi önemli ölçüde değişir: gerçek zamanlı kullanıcı arayüzleri pratik hale gelir ve LLM'lerle otomatikleştirilmesi çok pahalı olan işlem hattı adımları her yerde çalıştırılabilecek kadar ucuz hale gelir.
TypeSafe'in önerilen kullanım örnekleri arasında verilerin sınıflandırılması ve yönlendirilmesi, LLM çıktılarının doğrulanması ve korunması, jailbreak'lerin tespit edilmesi ve büyük veri kümeleri (çevreleyen kodun modelin özgürlüğünü sınırlayabileceği ve hataları yakalayabileceği iş yükleri) üzerinde harita azaltıcı analiz yer alır.
Şirket açık sorular konusunda samimi: Yayınlanan değerlendirmeler ABD'nin Batı Kıyısı'ndaki dizüstü bilgisayarlardan yapıldı ve uzun vadeli fiyatlandırma sürdürülebilirliği henüz kanıtlanmadı. Jev'in istihbarat iddialarının hayatta kalıp kalmayacağı, bağımsız testlerle temasa geçerek "Birinci Sistem Modelleri"nin bir kategori mi yoksa merak konusu mu olacağını belirleyecek.
Şirketin web sitesi üzerinden erken erişime açıldı.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →