OpenAI'nin GPT-6 Astra'sı kodlama cephesinde kullanıcı güveni sorunlarıyla mücadele ediyor olabilir, ancak yeni bir robotik kıyaslamasında araştırmacıların niteliksel bir sıçramadan bahsetmesine neden olacak rakamlar yayınlıyor. Sıradan masa nesneleri üzerine yapılan bir test olan StationeryBench'te Astra 100 görevden 7'sini tamamen tamamlarken, Ai2'nin karşı karşıya geldiği model olan MolmoAct2 sıfırı tamamladı.

The Decoder tarafından açıklanan kıyaslama, iki modeli beş masa nesnesi görevinde (bir kalemin kapağını açmak, ataçları dökmek veya iki robot kolu arasından bir cetvel geçirmek) karşı karşıya getiriyor. Her iki model de 200 deneme boyunca aynı çift kollu YAM robotlarını kontrol etti; bu, model kapasitesini donanım farklılıklarından ayırmayı amaçlayan bir kontrol tasarımıydı. Tüm sonuçlar, videolar ve kodlar GitHub'da yayınlandı. Bunun gibi daha fazla araştırma kapsamı için AI haber merkezimize göz atın.

Araştırmacılara Göre 'Adım Değişimi'

Cornell ve Google DeepMind'da yapay zeka araştırmacısı olan Yoav Artzi, Astra'nın performansını "mekansal akıl yürütmede adım adım bir değişiklik" olarak nitelendirdi; bu, dil kıyaslama sonuçlarının nadiren kazandırdığı türden bir şey. REMAP adı verilen henüz yayınlanmamış bir kıyaslamada Astra, insan seviyesine yakın bir doğruluğa ulaşıyor, ancak Artzi "Astra'nın bile insanların diğer senaryolarda yaptıklarını elde edemediğini" belirtti.

Astra'nın ortalama ilerleme puanı 100 üzerinden 46'ya ulaşırken, MolmoAct2'ninki 12'ydi; bu, manşet tamamlama rakamlarının önerdiğinden daha önemli bir boşluk. Robotik görevleri, tam başarının yanı sıra kısmi ilerlemeye göre de derecelendiriliyor ve rakibin ortalama puanının üçe katlanması, modelin bir avuç denemede şans eseri başarılı olmak yerine, manipülasyon dizileri yoluyla sürekli olarak ilerlediğini gösteriyor.

Uzamsal Muhakeme Neden Aniden Önemli Oldu?

Sonuç, Astra'nın nasıl eğitildiğine dair ipuçları veriyor. Artzi, OpenAI'nin modeli Blender sahneleri gibi büyük miktarlarda 3D veriler üzerinde eğittiğinden şüpheleniyor; bu, modelin 3D görevlerdeki özel gücüyle uyumlu olacak. Eğer bu yorum doğruysa, gerçek dünyadaki veri toplamadan daha ucuz ve daha güvenli olan sentetik 3 boyutlu ortamların, robot bilimindeki en uzun süredir devam eden darboğazlardan biri olan fiziksel dünya yeterliliğine giden geçerli bir yol haline geldiği öne sürülüyor.

Karşılaştırmalı değerlendirmenin tasarımı aynı zamanda robotik değerlendirmesinin nereye gittiği hakkında da bir şeyler söylüyor. StationeryBench'in görevleri kasıtlı olarak sıradandır - bir kalemin kapağını açmak, ataçları dökmek, bir cetveli teslim etmek - çünkü laboratuvar demolarını kullanışlı makinelerden ayıran şey sinematik beceriler değil, günlük manipülasyonlardır. Her iki modeli de 200 deneme boyunca aynı çift kollu YAM donanımı üzerinde derecelendirmek ve her videoyu yayınlamak, bir öncü laboratuvarın amiral gemisini içeren bir yetenek iddiası için alışılmadık derecede şeffaf bir kurulumdur.

Allen Yapay Zeka Enstitüsü'nün (Ai2) karşılaştırma modeli olan MolmoAct2, görevlerin hiçbirini tamamlamayan kendine özgü bir veri türü değil: genel amaçlı sınır modelleri ile amaca yönelik olarak oluşturulmuş robotik modeller arasındaki boşluğun artık sadece kapanmadığını, en azından muhakeme ağırlıklı manipülasyonda tersine döndüğünü öne sürüyor.

Aynı zamanda OpenAI'nin belirttiği hedeflere de uyuyor: The Decoder'ın aktardığı rapora göre şirketin kendi tüketici robotlarını inşa etmek için uzun vadeli planları var. Nesneler, eller ve yörüngeler hakkında mantık yürütebilen bir sınır dil modeli, bu adımın yazılım kısmıdır. Donanım kısmı henüz çözülmemiş durumda ancak StationeryBench gibi kıyaslamalar bu hikayenin nasıl ölçüleceğini gösteriyor.

Bağlam: Karmaşık Bir Haftaya Sahip Bir Model

Sonuç, OpenAI için tuhaf bir haber döngüsüne giriyor. Bu kıyaslamanın merkezinde yer alan aynı model, haftayı, piyasaya sürülmesinden bu yana daha da aptallaştığına dair kullanıcı şikayetleriyle karşı karşıya kaldı - OpenAI, Codex kullanım sınırlarını sıfırlamadan önce, hatalı ateşleme becerilerinden, hatalı davranan bir bağlam deneyine kadar adlandırılmış üç kusurun izini sürdü. Laboratuvarda adım değişikliği sonuçlarını yayınlarken üretimde tökezleyen bir model, mevcut yapay zeka endüstrisinin özetidir: yetenek ve güvenilirlik farklı saatlerde ilerlemektedir.

Aynı zamanda OpenAI'nin kendi liderliğinin de katıldığı bir güvenlik tartışmasının ortasında yer alıyor. Şirketin baş bilim insanı, hiçbir laboratuvarın giderek otonomlaşan sistemlerin kontrolünü çözemediği konusunda uyardı ve Anthropic'in CEO'su, endüstrinin sınır gelişimini tamamen yavaşlatması çağrısında bulundu. Dünya yalnızca kırtasiye malzemeleriyle kaplı bir masadan ibaret olsa bile, fiziksel dünyayı manipüle eden modelleri gösteren karşılaştırmalar, her iki yöneticinin de ilerleme hızının gözden kaçtığını iddia ederken bahsettiği türden sonuçlardır.

Özet Bilgi

100 görevden yedisi tamamen tamamlanmışsa, yarın masanıza bir robot konmayacaktır. Ancak rakibin sıfırdan yediye, üç kat daha yüksek bir ortalama ilerleme puanına sahip olması, iki yıl önce dil anlama konusundaki yetenek çizelgelerini yeniden çizen türden bir süreksizliktir. Açık soru, aynı modelin bu yeterliliği, karşılaştırmalı değerlendirmenin dışında, geliştiricilerin ödemeye hazır olduğu bir fiyatla güvenilir bir şekilde sağlayıp sağlayamayacağıdır.

Yapay Zekanın Önünde Olun

Karşılaştırmalar, atılımlar ve harekete geçen makinelere yönelik yarış her gün takip ediliyor.

Daha fazla AI haberini okuyun →