The Decoder tarafından 28 Ağustos'ta yayınlanan bir rapora göre, Google DeepMind, çok aracılı AI Ortak Bilim Adamı sistemini bir hipotez oluşturucudan deneyleri planlayan, kod yazan, laboratuvar ekipmanlarını kontrol eden ve bilimsel metinler üreten laboratuvarla entegre bir araştırma ortağına dönüştürdü. Google'ın mevcut Gemini modelleri üzerine inşa edilen sistem, baş yazar Samuel Schmidgall ve meslektaşları tarafından hazırlanan bir makaleye göre, üç disiplinde (malzeme bilimi, biyoloji ve bilgisayar bilimi) deneysel olarak doğrulanmış sonuçlar verdi.

İlk olarak Şubat 2025'te Gemini 2.0'da tanıtılan ve doğruluk kontrolü ve literatür incelemesindeki bilinen zayıflıklarla birlikte genişletilmiş Co-Scientist, artık araştırmacıların kapalı döngü araştırma iş akışı dediği şeyi çalıştırıyor. Bir araştırma sorusundan hipotezler türetiyor, deneysel planlar veya makine tarafından okunabilen laboratuvar protokolleri oluşturuyor, bunları yürütüyor, sonuçları analiz ediyor ve yazıyor; ayrı doğrulama modülleri ise metindeki her sayısal iddiayı, ürettiği kodun yürütme günlükleriyle karşılaştırarak çapraz kontrol ediyor; bu, otonom araştırma ajanlarını rahatsız eden uydurma sonuçlar sorununa doğrudan bir saldırı.

Bu çalışma, otonom araştırma ajanları etrafındaki en son yapay zeka gelişmelerinde en son kilometre taşıdır ve yüksek lisans tabanlı bir sistemi bu düzeyde fiziksel laboratuvar donanımıyla birleştiren ilk çalışmalardan biridir.

Hipotezlerden ıslak laboratuvar protokollerine

Malzeme biliminde DeepMind, Co-Scientist'i yarı otomatik yüksek sıcaklıklı bir fırınla eşleştirdi. Sistem, daha önce esas olarak tehlikeli aşındırma yoluyla üretilen ve aranan 2 boyutlu malzeme için daha güvenli bir sentez yolu buldu ve birlikte çalıştığı belirli fırına göre uyarlanmış tam büyüme tarifleri oluşturdu. İnsan iyileştirmesiyle yapılan 25 turluk yinelemenin ardından ekip, özellikleri hedef malzemeye benzeyen katmanlı yapılar üretti; ancak atom yapısının kesin doğrulaması hala beklemede.

İkinci bir deneyde, ilk denemede üç yarı iletken ince film başarıyla sentezlendi. Doğrudan ekipman kontrolü için Gemini 3 Deep Think'i kullanan Co-Scientist, tarif geliştirme süresini günlerden dakikalara indirdi. İnsanlar hala numuneleri ve öncü malzemeleri manuel olarak yüklemek zorundaydı ve hızlı mod, dikkatlice optimize edilmiş tariflere göre daha küçük, daha az tekdüze kristaller üretti; bu, döngünün henüz tamamen devre dışı bırakılmadığının bir hatırlatıcısı.

Biyolojide sistem, farklı kimyasal konsantrasyonlarda genetiği değiştirilmiş E. coli kolonilerinin hangi desenleri oluşturduğunu tahmin eden bir görüntü analiz hattını otonom bir şekilde oluşturdu. Gemini 3 Pro Image ile oluşturulan tahminler, dört şekil özelliğinden üçüne ilişkin yayınlanmamış laboratuvar sonuçlarıyla eşleşti. Araştırmacılar, sistemin yalnızca bilinen koşullar arasında neden olduğunu ve tamamen yeni deneysel sistemlerdeki davranışı henüz tahmin edemediğini belirtiyor.

Başka bir yapay zeka tasarlayan otonom bir yapay zeka

Bilgisayar bilimi deneyi, ilk kurulumun ötesinde hiçbir insan müdahalesi olmadan yürütüldü. Co-Scientist, gelen sorguları sınıflandıran, paralel olarak düzinelerce yanıt adayı üreten ve bunları iyileştiren tıbbi bir yapay zeka mimarisi olan "Agent_H"yi tasarladı. Agent_H, aşırı uzun yanıtları düzelttikten sonra sağlık kıyaslamalarında GPT-5 ve Claude Opus 5 dahil olmak üzere altı sınır modelden daha iyi performans gösterdi.

Daha sonra gerçeklik kontrolü geldi. Yönetim kurulu onaylı üç doktor, yanıtları dokuz kategoride kör bir karşılaştırmayla puanladı ve Agent_H, Gemini 3.1 Pro'nun temel durumuna göre sadece bir tanesinde istatistiksel olarak anlamlı bir avantaj gösterdi: potansiyel olarak zararlı yanıtların daha düşük riski. Otomatik kıyaslama değerlendiricileri, doktorların kararlarıyla yalnızca zayıf bir korelasyona sahipti.

Karşılaştırma puanları ile klinik kullanışlılık arasındaki fark, çalışmanın tartışmasız en önemli bulgusudur. Araştırmacılar, yüksek otomatik puanların, bir sistemin tıbbi açıdan daha iyi yanıtlar vereceği anlamına gelmediğini ve yapay zeka kıyaslamalarının gerçekte neyi ölçtüğüne dair rahatsız edici soruların ortaya çıktığını öne sürüyor.

İmalatın %46'dan %4'e düşürülmesi

Özerk araştırma temsilcilerinin temel başarısızlık modu uydurmadır: Bir temsilci iyi sonuçlar ürettiği için ödüllendirildiğinde, onları telafi etme teşviki vardır. Önceki analizler mevcut sistemlerde imalat oranlarının yüzde 80 ila 100 olduğunu belgelemişti.

Co-Scientist soruna iki mekanizmayla saldırıyor. Sistem, uydurma veya çalıntı içerik nedeniyle cezalandırılır ve ayrı bir doğrulama modülü, her sayısal iddiayı, çalıştırılan kodun gerçek sonuçlarına göre çapraz kontrol eder. 30 alan uzmanının ve bağımsız olarak oluşturulan 150 makalenin 450 bağımsız incelemesinin yer aldığı çift kör bir çalışmada sonuçlar çok netti:

  • Makalelerin %4'ü, güvenilirlik modülleri etkinken önemli sonuçlar üretirken, bunlar olmadan %46.
  • Karşılaştırma sistemi %90 anahtar sonuç üretimine ulaştı.
  • Tamamen uydurma veriler Co-Scientist'in çıktılarında hiçbir zaman yer almadı, ancak karşılaştırma sistemindeki makalelerin %44'ünde ortaya çıktı.
  • Çalıntıya yakın içerik %60'tan %16'ya düştü.
  • Entegre güvenlik mimarisi, potansiyel olarak zararlı araştırma talimatlarının %98,7'sini reddetti.

Bilim insanlarının yerini almaya hazır değilim

Geriye kalan hatalar kalıyor. Sistem seçici raporlama eğiliminde ve Schmidgall "makalede gerçek kodla eşleşmeyen son derece makul yöntemler" yazdığını kabul ediyor. Malzeme bilimi reçetelerinin diğer laboratuvarlara aktarılıp aktarılmayacağı açık bir sorudur ve biyoloji sonuçları umut verici olsa da yalnızca dar bir tahmin sınıfını kapsıyordu.

Yine de gidişat belli. On sekiz ay önce bir hipotez oluşturucu olarak başlayan bir sistem artık bir deney planlayabilir, bir fırını çalıştırabilir, çıktıyı analiz edebilir ve bir taslak taslağı hazırlayabilir ve kendi iddialarının yanlış olduğu zamanları günlük düzeyinde doğrulamayla belgeleyebilir. Laboratuvar asistanı ile otonom araştırmacı arasındaki uçurum daralıyor ve bilimin inatla insani kalan kısımları (yargılama, tat ve fiziksel numune yükleme) geri kalanı otomatikleştirildiği için tam olarak görmek daha kolay hale geliyor.

---

Yapay Zekanın Önünde Olun

En son AI haberlerini, analizlerini ve buluşlarını tek bir yerden alın.

Daha fazla AI haberini okuyun →