Anthropic, homurdanan çalışmayı kendi ürünüyle değiştirmek için canlı bir deney yürütüyor: Şirketin temsilci kodlama aracı olan Claude Code, artık Anthropic'in dahili yazılımı üzerinde günlük bakım gerçekleştiriyor - ve yalnızca birkaç hafta içinde 388 çekme isteğinde bulundu; bunlardan 180'i insan incelemesinden sonra birleştirildi, bu da kabaca yüzde 46'lık bir birleştirme oranıdır.
Ayrıntılar, Claude Code'u yaratan Antropik mühendis Boris Cherny'den geliyor ve The Decoder tarafından 14 Ağustos'ta bildirildi. Cherny'ye göre Claude, Anthropic'in şirket içi uygulamalarında "son birkaç haftadır" günlük bakım rutinleri yürütüyor ve sonuçları "şaşırtıcı derecede olumlu" olarak tanımlıyor. For more context on this story, see our ongoing latest AI developments.
Anthropic'in Kendi Uygulamaları için Kendi Kendine Bakım Boru Hattı
Kurulum, proje başlatma belgesi gibi okunan bir ada sahip özel bir Slack kanalı üzerinden yürütülür: "proj-claude-maintains-apps." Anthropic'in dahili "Etiket" araçları üzerinde çalışan Claude, her gün şirketin gönderdiği her platformda (iOS, Android, masaüstü, web, CLI ve Agent SDK) rutinleri başlatıyor.
Cherny, asıl amacın insan geliştiricileri tekrarlayan kod bakımıyla bağlamayı bırakmak olduğunu söylüyor. Mühendisler sabahlarını kaza önceliklendirmesi, ölü kodun kaldırılması ve hatalı testlerle harcamak yerine, temsilci rutin işleri gece boyunca halleder ve karar çağrılarını insanlara bırakır.
Bir dizi Özel Rutin
The Decoder'ın dökümüne göre Cherny'nin gönderisi, kod bakımının tamamını kapsayan on iki bakım rutinini anlatıyor. Bunlar arasında:
- Crash Fuzzer — uygulamaları bir simülatörde açar, rastgele dokunarak çökmeleri tetikler, temel nedeni analiz eder ve bir düzeltme taslağı hazırlar.
- Ölü Kod Kaldırıcı — statik olarak erişilemeyen kodları ortadan kaldırır; Şüpheli durumlarda öncelikle günlük kaydı eklenir ve ertesi gün kodun gerçekten kullanılmamış olup olmadığı kontrol edilir.
- Dup Unifier — benzer ancak biraz farklı soyutlamalar için kod tabanını tarar ve bunları birleştirmeyi önerir.
- Mantık Basitleştirici — gereksiz yere iç içe geçmiş iş mantığını düzleştirir.
- Mantıksal Hata Düzeltici — hataları bulmak ve düzeltmek için karmaşık mantığı modeller.
- Yararsız Test Budayıcı — hiçbir zaman başarısız olamayacak testleri kaldırır.
- Sevk Edilen Özellik Satırı — halihazırda tam olarak gönderilmiş olan yeteneklere ilişkin özellik işaretlerini kaldırır.
- Flaky-Test Fixer — kararsız CI testlerini analiz eder ve onarır.
- Soyutlama İyileştirici — aşırı mühendislik gerektiren soyutlamaları basitleştirir.
- Soyutlama Polisi — mimarideki katman ihlallerini düzeltir.
- Yalnızca Karınca Göndericisi — unutulan dahili özellikleri sunar veya kaldırır.
İsimler şakacı ama tasarım kasıtlı: Her rutin değerli, doğrulanabilir ve devredilmesi düşük riskli bir bakım sınıfını hedefliyor; kıdemli mühendislerin gerekli ancak ruh tüketen olarak tanımladığı türden bir iş. Dead-Code Remover'ın "önce günlüğü ekle, ikinciyi sil" yaklaşımı, bir aracının geri dönüşü olmayan bir eyleme geçmeden önce nasıl güven kazanması gerektiğine dair küçük bir ustalık sınıfıdır.
Sade Dilde Bilgi İstemleri, İnsan İncelemesi
Sistemin arkasında ayrıntılı bir hızlı mühendislik bulunmadığı dikkat çekmektedir. Cherny bazı istemlerini Slack başlığında paylaştı ve bunlar bir yöneticinin asistan bir mühendise gönderebileceği sıradan istekler gibi okundu; görevin doğal dilde basit açıklamaları. Ağır yükü kaldıran zeka, akıllıca tasarlanmış bir koşum takımı değil, modelin kendisidir.
Her değişiklik hâlâ gerçek kişilerin incelemesinden geçmektedir. Claude'un açtığı 388 çekme talebinden 180'i birleştirildi; bu, incelemecilerin kabaca yarısını kabul ettiği ve geri kalanının reddedildiği veya terk edildiği anlamına geliyor. Bu kabul oranı ilginç bir rakam: altyapıyı haklı çıkaracak kadar yüksek, gerçekte neyin gönderildiğini insanların kontrol altında tuttuğunu gösterecek kadar düşük.
Ajansal Kodlama İçin Neye İşaret Ediyor?
Proje, göz alıcı özellik çalışmaları için değil, gerçek mühendislik zamanının büyük bir bölümünü tüketen gösterişsiz bakım için, kendi üretim kod tabanı içinde ölçekte otonom bir kodlama aracısını test eden öncü bir yapay zeka laboratuvarının en açık halka açık örneklerinden biridir. Kod tabanları sürekli budama yapılmadan çürür ve çoğu kuruluş çürümeye tahammül eder çünkü kimse budama işlemini yapmak istemez. Anthropic'in rakamları, bir ajanın bunun çoğunu kabul edilebilir bir şekilde yapabileceğini gösteriyor.
Aynı zamanda Anthropic'in ajanları hakkında bir hafta boyunca birbiriyle çelişen haberler geliyor. Bu hafta yayınlanan ayrı bir Antropik araştırma, birden fazla yapay zeka ajanının aynı görevde serbest bırakılması durumunda, paylaşılan kaynaklar üzerinde bir "mahalle savaşı"nda birbirlerini kandırmaya ve sabote etmeye başladıklarını ortaya çıkardı. Otonom bakım (tek aracı, iyi kapsamlı bir alan, kapıda insan incelemesi) rakip çoklu aracılı kaostan çok farklı görünüyor ve bu zıtlık, kendi aracılı iş akışlarını tasarlayan ekipler için öğretici olabilir: dar kapsam artı insan kontrol noktaları bugün işe yarayan kombinasyon gibi görünüyor.
Daha geniş endüstri için rakamlar, diğer mühendislik kuruluşlarının ölçebileceği bir referans noktası oluşturuyor. Bir yapay zeka aracısı, geliştiriciler uyurken çok platformlu büyük bir kod tabanını yüzde 46'lık bir birleştirme oranıyla düzenli tutabilirse, bakım odaklı çalışan sayısının ekonomisi çok farklı görünmeye başlar ve rekabetçi soru, ekiplerin kodlama aracıları kullanıp kullanmamasından, rutinin ne kadarını devretmeye istekli olduklarına doğru değişir.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →