Remote Labor Index'in en son sonuçlarına göre yapay zeka temsilcileri artık gerçek serbest çalışma işlerinin yüzde 16'sını, ödeme yapan müşterilerin kabul edeceği bir kalite düzeyinde tamamlayabiliyor; bu, yalnızca sekiz ay önce kaydedilen oranın dört katından fazla. Bulgu, otonom yapay zeka sistemlerinin profesyonel yaratıcı ve teknik çalışmalara ne kadar hızlı müdahale ettiğinin şimdiye kadarki en somut önlemlerinden birini sağlıyor.
Center for AI Safety tarafından Scale Labs ile işbirliği içinde geliştirilen Uzaktan Çalışma Endeksi (RLI), AI temsilcilerinin ticari açıdan değerli serbest çalışma projelerini profesyonel kalitede ne sıklıkla tamamlayabildiğini izliyor. Karşılaştırma, 3D ve CAD tasarımı, mimari, grafik tasarım, video ve animasyon, ses üretimi, veri analizi ve web uygulaması geliştirme gibi alanları kapsamaktadır. Toplam 144.000 $ değerindeki 358 onaylı serbest çalışandan alınan 240 projeyi değerlendiriyor. İnsan değerlendiriciler, her sonucu ücretli bir profesyonel tarafından oluşturulan altın standarda göre puanlayarak, AI endüstrisinin büyüyen yeteneklerine ilişkin ampirik bir anlık görüntü sunar.
Sayılar: Dört Kattan Fazla Bir Sınır
Karşılaştırma ilk kez başlatıldığında, en iyi yapay zeka aracısı projelerin yalnızca yüzde 2,5'ini otomatikleştirdi. En son sonuçlara göre Anthropic'in Fable 5 modeli şu anda yüzde 16,1'e ulaşıyor; bu, endekste şimdiye kadar kaydedilen en yüksek puan. Bu, Opus 4.8'in yüzde 8,3'ünün kabaca iki katı ve GPT-5.5'in yüzde 6,3'ünün oldukça ilerisinde.
Üç öncü modelin tümü daha önce test edilen sistemlerin hepsini geride bıraktı. Önceki lider, Claude Cowork çerçevesinde çalışan Opus 4.6 yüzde 4,17 seviyesindeydi. Karşılaştırmalı değerlendirmenin yazarlarına göre, otomasyon kapasitesinin sınırı sekiz aydan kısa bir sürede dört kattan fazla arttı.
Ancak sonuçlar, çıkış tarihlerine göre aynı doğrultuda hareket etmiyor. Tam Scale Labs sıralamasında, yeni Gemini 3 Pro yalnızca yüzde 1,25 ile dibe yakın bir yerde yer alıyor ve çok daha eski sistemlerin gerisinde kalıyor. Bu, ham model yeteneğinin, karmaşık mesleki görevler için gerekli olan araç kullanma ve muhakeme becerilerine otomatik olarak dönüşmediğini göstermektedir.
Karşılaştırma Nasıl Çalışır?
Ekip, modellerin tam yeteneklerini göstermelerine olanak sağlamak için onları, Claude Code ve Codex CLI dahil olmak üzere mühendislerin her gün kullandığı aynı geliştirme araçlarında çalıştırıyor. Bu ortamlar, grafik programların doğrudan çalıştırılabilmesiyle genişletildi.
Her AI aracısı, 3D modelleme için Blender, görüntü düzenleme için GIMP ve ses üretimi için Audacity dahil olmak üzere 30'dan fazla profesyonel uygulamayla yüklü sanal bir Linux makinesinde çalışır. Projelere 24 saate kadar hesaplama süresi verilir; bu, tipik bir sohbet robotu etkileşiminden çok daha uzundur.
Kurulum aynı zamanda bir kritik döngüsü de kullanıyor: İkinci bir yapay zeka aracısı, çıktıyı talepkar bir müşterinin yapacağı kadar eleştirel bir şekilde inceliyor ve ilk aracı daha sonra bu geri bildirime göre işini revize ediyor. Bu, serbest çalışanların teslimatları geliştirirken takip ettiği yinelemeli süreci yansıtıyor.
Yapay Zekanın Hala Yetersiz Kaldığı Yer
Hızlı ilerlemeye rağmen yapay zeka temsilcileri projelerin büyük çoğunluğunda hala profesyonel kaliteye ulaşamıyor. Karşılaştırmalı değerlendirmenin blog yazısı, en üst modelin çıktısının bile bitmiş iş olarak geçemeyeceği belirli örnekleri vurguluyor.
Bir halka tasarımı görevinde Fable 5, daha önceki yapay zeka girişimlerinden açıkça daha iyi olan ancak yakından bakıldığında yine de profesyonellikten uzak görünen bir sonuç üretti. Bir mimari projede, GPT-5.5, bir görüntü oluşturucu kullanarak çekici bir görüntü oluşturmuşken, temeldeki gerçek 3D modeli kusurlu kalmıştı; bu, ödeme yapan bir müşterinin yalnızca kaynak dosyaları açarak keşfedebileceği bir kısayoldu.
Karşılaştırmalı değerlendirmedeki daha karmaşık görevlerden biri, temsilciden, taranmış bir kadastral plandan, saha fotoğraflarından ve ölçümlerden boyutlu bir kat planı, mobilya yerleşim seçenekleri ve fotogerçekçi banyo görselleri oluşturmasını ister. Hem teknik hassasiyet hem de yaratıcı muhakeme gerektiren bu çok adımlı iş akışı, mevcut sistemler için önemli bir zorluk olmaya devam ediyor.
Yapay Zeka Jürileri Çok Cömert Olarak Değerlendiriyor
Araştırma ekibi ayrıca pahalı insan değerlendirmesinin yerini yapay zeka hakimlerinin alıp alamayacağını da test etti. Cevap kesindi: Yapay zeka değerlendiricileri yeni modelleri fazlasıyla cömert bir şekilde değerlendirdi. GPT-5.5 için AI jürisinin puanı neredeyse üç kat fazlaydı. Opus 4.8 için bu oran kabaca iki buçuk kat fazlaydı.
Otomatik jüri genel sıralamayı doğru yapmış olsa da gerçek rakamlar önemli ölçüde şişirilmişti. Yapay Zeka Güvenliği Merkezi bunun nedenini açıkladı: Teslim edilen işi adil bir şekilde değerlendirmek için, değerlendiricinin dosyaları doğru profesyonel yazılımda açması, bu yazılımı düzgün bir şekilde çalıştırması ve ödeme yapan bir müşterinin yapacağı gibi bir karara varması gerekir. Bu tür uygulamalı yazılım kullanımı, mevcut yapay zeka ajanlarının en çok uğraştığı şeydir.
Buradaki ironi öğreticidir: Bir yapay zeka yargıcı, değerlendirmesi gereken yapay zeka çalışanlarıyla aynı sınırlamalarla karşılaşır. GPT-5.5'in sahte görüntüsü buna bir örnektir; aldatmacayı yakalamak için 3 boyutlu modelin açılması ve gerçek geometrinin incelenmesi gerekir; bu da yapay zeka hakeminin güvenilir bir şekilde gerçekleştiremeyeceği bir görevdir.
Uyarı: Hükümet Kısıtlamaları
Fable 5'in önde gelen puanıyla ilgili önemli bir uyarı var. Amerika Birleşik Devletleri hükümeti modele erişimi kısıtlamadan önce 240 projeden yalnızca 218'i değerlendirilebildi. Fable 5'in kalan tüm projelerde başarısız olduğu en kötü senaryoda bile otomasyon oranı yine de yüzde 14,6 olacaktır; bu da test edilen diğer modellerden daha yüksektir.
Mythos sınıfı modellerle ilgili ulusal güvenlik endişeleriyle bağlantılı hükümet kısıtlamaları, değerlendirme penceresini sınırladı ancak temel bulguyu zayıflatmadı: Yapay zeka ajanları, profesyonel serbest çalışmanın anlamlı bir kısmını üstlenebilecekleri noktaya hızla yaklaşıyor.
Serbest çalışanlar için bu trend ayıltıcı ama henüz felaket değil. Yapay zeka hâlâ projelerin yüzde 84'ünde başarısız oluyor ve karşılaştırmalı değerlendirme örnekleri, başarılı çıktıların bile çoğu zaman profesyonel revizyon gerektirdiğini gösteriyor. Ancak otomasyon oranının bir yıldan kısa sürede dört kattan fazla artmasıyla gidişat net. Artık soru, yapay zeka ajanlarının serbest çalışma için rekabet edip etmeyeceği değil, kalan açığı ne kadar hızlı kapatabilecekleridir.
Yapay Zekanın Önünde Olun
En son yapay zeka haberlerini, analizlerini ve buluşlarını tek bir yerden alın.
Daha fazla AI haberini okuyun →


