Yeni bir kıyaslama, yapay zeka endüstrisinin bilimsel yeteneği nasıl ölçtüğünü zorluyor ve ilk sonuçları öncü laboratuvarlar için utanç verici. Stanford Üniversitesi'ndeki araştırmacılar ve popüler Terminal-Bench kodlama testinin arkasındaki ekip tarafından bu hafta başlatılan Terminal-Bench-Science 0.1, yapay zeka aracılarını, çalışan bilim insanlarının katkıda bulunduğu gerçek bilimsel araştırma iş akışları üzerinde değerlendiriyor - ve test edilen en güçlü model olan Claude Opus 5, Claude Code üzerinden çalışarak görevlerin yalnızca %30'unu tamamladı.

Karşılaştırmalı değerlendirmenin duyuru sayfası, yol gösterici ilkesini açık bir şekilde açıklıyor: Model geliştiriciler veya veri satıcıları değil, bilim insanları yapay zekada bilimsel yetenek için çıtayı belirlemeli. Proje, dünya çapındaki araştırma kurumlarından alan uzmanlarıyla işbirliği içinde oluşturuldu ve ilk sürümünde yaşam bilimleri, fizik, yer bilimleri, matematik ve mühendisliği kapsayan 70 görev yer alıyor.

Ders Kitabı Karşılaştırmalarından Ne Kadar Farklı?

Bilimsel yapay zeka değerlendirmelerinin çoğu bilgiyi test eder: çoktan seçmeli sorular, ders kitabı problemleri, standartlaştırılmış alıştırmalar. Terminal-Bench-Science bunun yerine aracıların, gerçek araştırmacıların günlerini dolduran teknik açıdan zorlu, zaman alıcı iş akışlarını (hiçbir sınavda görülmeyen türden işler) yürütüp yürütmediklerini ölçer. Görevler gerçekçi ortamlarda gerçekleştirilir ve derecelendirme somut eserlere dayanır: değerlendirme modelleri veya çoktan seçmeli puanlama yerine tekrarlanabilir göreve özel testlerle kontrol edilen analizler, simülasyonlar, kanıtlar, kod ve veri ürünleri.

Bu tasarım, yapay zeka asistanlarının bilim için eninde sonunda ne yapması gerektiğine dair bir teoriyi yansıtıyor. Karşılaştırmalı değerlendirmenin yazarları, bilimsel yargının yerini almak yerine, temsilcilerin deneyleri silico'da yürütme, verileri işleme, kanıtları kontrol etme gibi yürütme katmanını devralması gerektiğini ve böylece bilim insanlarının insan yargısının en önemli olduğu araştırma bölümleri için serbest bırakılması gerektiğini öne sürüyor: soruları tanımlamak, hipotezler oluşturmak, sonuçları yorumlamak ve bulguları iletmek.

Proje aynı zamanda açıkça hareketli bir hedef olarak inşa edilmiştir. Pek çok kıyaslamanın bir kez yayınlanıp terk edildiği durumlarda - duyuru buna "yayınlanacak makaleler" sorunu diyor - Terminal-Bench-Science, değerlendirmeyi model ilerlemesinin önünde tutmayı ve kontaminasyona dayalı puan enflasyonunu önlemeyi amaçlayan düzenli sürümlerle, sınır boyunca gelişen sürekli bir kıyaslama olarak tasarlanmıştır.

İlk Skor Tablosu: Güvenilirlikten Uzak Bir Yol

Bu hafta Hacker News'e ulaştığında büyük ilgi gören v0.1 skor tablosunda zirveden keskin bir düşüş görülüyor:

  • Claude Opus 5 (Claude Kodu): %30,0
  • GPT-5.6 Sol (Kodeks): %22,4
  • Claude Fable 5 (Claude Kodu): %21,4
  • Claude Opus 4.8 (Claude Kodu): %10,5
  • GPT-5.6 Terra (Kodeks): %8,6
  • GLM 5.3 (Claude Kodu): %8,1
  • Kimi K3 (Claude Kodu): %7,1
  • Grok 4,6 (Grok Yapısı): %7,1
  • GPT-5.6 Luna (Kodeks): %3,3

Sonuçlar, bilimsel iş akışlarının temsilciler için, orijinal Terminal-Bench ve rakip kodlama kriterlerinin puanların hızla arttığını gördüğü yazılım mühendisliğine göre önemli ölçüde daha zor olduğunu gösteriyor. Mevcut en iyi sistem için %30'luk çözünürlük oranı, on gerçek araştırma görevinden yedisinde, güçlü bir koşum takımıyla eşleştirilen üst düzey bir temsilcinin bile doğrulanabilir şekilde doğru işler üretemediği anlamına gelir.

Model ailelerdeki dağılım da öğreticidir. Claude Opus 5 ile Claude Opus 4.8 arasındaki (neredeyse yirmi puan) ve GPT-5.6 varyantları Sol, Terra ve Luna arasındaki fark, sonuç kalitesinin ne kadar yalnızca ham model zekasına değil, model ve aracı donanımının etkileşimine bağlı olduğunu gösteriyor. Yüksek puan alan her giriş, bir etken kodlama donanımı (Claude Code, Codex, Grok Build) kullanıyor ve bu da iskelenin temel ağırlıklar kadar belirleyici olduğu konusunda ortaya çıkan fikir birliğini güçlendiriyor.

Bilim Adamları Neden Kendi Kriterlerini Oluşturdular?

Kriterin çerçevesi incelikli bir kurumsal argüman taşıyor. Duyuruda, "Bilimdeki riskler çok yüksek" ifadesine yer veriliyor ve "kıyaslama ölçütleri, dış çıkarlardan ziyade bilim camiasının önceliklerini yansıtmalıdır." Proje, çalışan araştırmacılara, gerçekten otomatikleştirmeye ihtiyaç duydukları görevleri kodlamaları ve satıcıların "bilimsel keşifleri hızlandırma" iddialarını doğrulanabilir bir standartla karşı karşıya getirmeleri için doğrudan bir mekanizma sağlıyor.

Bu önemlidir çünkü pazarlama ile gerçeklik arasındaki uçurumun gerçek sonuçları vardır. Sınır laboratuvarları, bağımsız, uzmanlar tarafından tasarlanmış değerlendirmeler tek haneli ila %30 arasında çözüm oranları gösterirken temsilcilerinin araştırmayı hızlandırabileceğini iddia ederse, bu iddialar üzerine oluşturulan finansman kararları, işe alma planları ve laboratuvar politikaları hatayı devralır. Sürekli, topluluğa ait kıyaslamalar bir düzelticidir: belirsiz iddiaları tekrarlanabilir sayılara dönüştürürler.

Araştırma Kurumlarına Bir Sinyal

Temsilcilerin ne zaman konuşlandırılacağını tartan üniversiteler, ulusal laboratuvarlar ve Ar-Ge ekipleri için bu kıyaslama, satıcı demolarının sunamayacağı bir şey sunuyor: güvenilirlik çizgisinin gerçekte nerede olduğuna dair topluluk tarafından sürdürülen bir ölçüm. Onlu veya yirmili yaşlardaki bir çözüm oranı, bu sistemlerin bugün deneysel hatların özerk uygulayıcıları olarak değil, gözden geçirilmesi gereken asistanlar olarak en iyi şekilde ele alınacağı anlamına gelir. Yaşam, fiziksel, Dünya, matematik ve mühendislik bilimlerini kapsayan görev kategorileri aynı zamanda alan uzmanlarına, genel kıyaslamaların rutin olarak gözden kaçırdığı alanlardaki iş akışlarına katkıda bulunmaları için bir şablon sağlar.

Daha geniş sektör bağlamı, zamanlamanın neden önemli olduğunu güçlendiriyor. Laboratuvarların malzeme keşfine, protein bilimine ve matematiğe katkılarının çığırtkanlığını yapmasıyla bilim, ileri düzey yapay zeka için en çok teşvik edilen kullanım örneklerinden biri haline geldi. Bu iddiaların denetlenmesi zordur: Bilimsel çıktının doğrulanması yavaştır ve ilgi, kopyalamadan daha hızlı hareket eder. Gerçek iş akışlarında doğrulanabilir eserleri derecelendiren bir kıyaslama, araştırma kurumlarına gösterilen yetenekleri gösteri tiyatrosundan ayırma ve bilimdeki etkin ilerlemenin, Terminal-Bench'in ilk kez adını duyurduğu yazılım mühendisliğinde olduğu kadar hızlı bir şekilde birleşip gelişmediğini, yayından yayına izlemenin bir yolunu sağlar.

Yapay zeka endüstrisi için v0.1'in mesajı iki uçludur. Sınır açıkça ilerlemektedir - Opus 5'in %30'u, eski Opus 4.8'in %10,5'inin üzerindedir - ancak tavan, gerçek laboratuvarların ihtiyaç duyduğu güvenilirlikten çok uzaktır. Benchmark tasarımcıları, düzenli sürümlerin bu farkın ne kadar hızlı kapandığını tam olarak izleyeceğini söylüyor. Ajans araştırma araçlarında ortaya çıkan yapay zeka trendlerini izleyen bilim adamlarının artık kendi oluşturdukları bir ölçütü var.

---

Yapay Zekanın Önünde Olun

En son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.

Daha fazla AI haberini okuyun →