Anthropic, Claude.ai ve Claude masaüstü uygulamasını iki haftalık bir sprintte nasıl yaklaşık üç kat daha hızlı hale getirdiğine dair ayrıntılı bir mühendislik raporu yayınladı ve işin ilginç yanı, işin çoğunun Claude tarafından yapılmasıydı. Anthropic'in mühendislik blogunda yayınlanan yazı, her iş parçacığında yapay zeka modeliyle tek bir Slack kanalından yürütülen, darboğazları bulan, kıyaslamalar oluşturan, iyileştirmeleri sevk eden ve her dağıtımı izleyen bir performans kampanyasını anlatıyor.
Yüzde 75'lik dilimde ölçülen rakamlar oldukça önemli. Yeni bir claude.ai yüklemesinde yazılabilir bir sayfaya ulaşma süresi 3,1 saniyeden 0,55 saniyeye düştü. Yeni bir Claude Code oturumunun başlatılması 0,8 saniyeden 0,3 saniyeye düştü ve Claude Cowork bulut oturumunun yüklenmesi 2,6 saniyeden 0,73 saniyeye düştü. Anthropic, iyileştirmelerin toplamda her gün on binlerce kullanıcı saatlik bekleme süresinden tasarruf sağladığını tahmin ediyor. For more context on this story, see our ongoing artificial intelligence updates.
Önce ölç, sonra hareket ettir
Sprint kod yerine ölçümle başladı. Bir Datadog MCP sunucusu aracılığıyla kullanım verilerini analiz etmek için Claude'u kullanan ekip, etkinliğin yüzde 95'ini oluşturan dört kullanıcı yolculuğunu belirledi: uygulamayı başlatmak, bir görüşme başlatmak, mevcut bir konuşmayı yüklemek ve bir mesaj göndermek. Web ve masaüstünde bu yolculuklar on üç farklı ölçüme bölündü ve ekip, her biri doğrudan karşılaştırılabilir hale gelene kadar enstrümantasyon ekledi; kullanıcı etkileşimiyle başlayıp sonuç oluşturulduktan sonra sona erdi.
Ekip, temel çizgileri belirledikten sonra her biri belirli bir yolculuğu hedefleyen yaklaşık yirmi adet özenle seçilmiş projeden oluşan bir liste hazırladı ve Claude'dan sprint hedeflerini belirlemek için her birinin etkisini milisaniye cinsinden tahmin etmesini istedi. Plan erkenden gerçekleşti: Antropik raporlar üçüncü günde on üç hedeften on ikisinin vurulduğunu bildirdi. Bu, Claude'a daha fazla fırsat belirlemesi ve yeni iş akışları önermesi için alan bıraktı; bu, hızla kendi projelerine dönüştü ve sonuçları orijinal hedeflerin ötesine taşıdı.
Gerçekte ne gönderildi?
Teknik değişiklikler, modern web performansı çalışmalarının bir kontrol listesi gibi okunuyor. Daha hızlı başlatmalar için ekip, kullanıcıların React başlatma sırasında yazmaya başlayabilmesi için HTML'ye statik bir oluşturucu ekledi ve bir V8 kod önbelleğini önceden derledi, böylece masaüstü kabuğunun ana işlemi artık başlangıçta sıfırdan yeniden derlenmiyor. Konuşmalar arasında daha hızlı gezinmek için, besteci parçalanıp yeniden oluşturulmak yerine takılı kalıyor, kullanıcı üzerlerine geldiğinde oturumlar önceden getiriliyor ve kenar çubuğunun yeniden oluşturulması yüzde 90 oranında azaldı.
Birleştirme geçmişinin ölçeği manşetteki rakamdır: Gönderiye göre, müşterinin karşılaştığı tek bir olay veya geri alma olmadan sprint sırasında üç binden fazla değişiklik yapıldı.
Claude Tag: korkulukları olan bir ajan
Sprint, Anthropic'in Claude Tag olarak adlandırdığı, şu anda beta aşamasında olan ve kabaca Opus 5.5 ile karşılaştırılabilir bir dahili araştırma modeli olarak tanımlanan model üzerinde yürütüldü. İşbölümü hikayenin en önemli kısmıdır. Claude darboğazları buldu, kıyaslamalar oluşturdu, düzeltmeler uyguladı ve her dağıtımı izledi; saatlerce, hatta gece boyunca eşzamansız olarak çalıştı. İnsanlar hedefleri belirledi, ödünler verdi ve birleşmeden önce her değişikliği onayladı.
Ekip aynı zamanda dağıtım temposundan daha hızlı yineleme yapmak istiyordu, bu nedenle gerçek dünyadaki okumalar için proxy olarak laboratuvar ölçümleri oluşturdu. Mühendislerin sorduğu sorular arasında şunlar vardı: JavaScript talimat sayımları, dağıtımdan önce prototipleri doğrulamak için daha hızlı bir geri bildirim sinyali olarak duvar saati zamanlamasının yerini alabilir mi?
Yapay zeka destekli mühendislik neden önemlidir?
Anthropic'in gönderisi, belirli optimizasyonlar (statik kabuklar, önceden getirme ve oluşturma azaltma yerleşik tekniklerdir) nedeniyle üretim ölçeğinde yapay zeka odaklı geliştirme hakkında gösterdiğinden daha az dikkate değerdir. Sınır laboratuvarı, amiral gemisi bir tüketici ürününün üç bin değişikliklik performans revizyonunu kısa süre önce teslim etti; yapay zeka temsilcileri tanımlama, uygulama ve doğrulama işlerinin büyük kısmını yaparken, insanlar da her değişiklikte onay yetkisini elinde tutuyordu.
Sonuç aynı zamanda yanıt verme yeteneğinin bir ürün özelliği olduğu rekabetçi bir bağlama da ulaşıyor. Claude, tüketici ve geliştiricilerin ilgisi konusunda OpenAI'nin ChatGPT'si ve Google'ın Gemini'siyle doğrudan rekabet ediyor ve algılanan hız, model kalitesi kadar yardımcı ürünlerin günlük kullanımını da şekillendiriyor. Etkileşime geçiş süresinin 3,1 saniyeden 0,55 saniyeye düşürülmesi, kullanıcıların ürünle ilgili en yaygın şikayetini gideriyor.
Dışarıdan izleyen mühendislik ekipleri için Anthropic'in anlatımından aktarılabilecek ders döngü yapısıdır: Kullanıcı yolculuklarını hassas bir şekilde ölçün, modelin bu ölçümlere göre değişiklikler önermesine ve doğrulamasına izin verin, bir insan onay kapısını tutun ve kapsamı yalnızca ölçüm sisteminin doğrulayabildiği kadar hızlı genişletin. Anthropic'in kendi yaklaşımına göre Claude bir şeyi ölçebildiğinde onu daha hızlı hale getirebilir; böylece ekip ölçecek daha fazla şey bulmaya devam etti.
Benzer aracı odaklı sprintlerin yazılım endüstrisinde standart uygulama haline gelip gelmeyeceği henüz bilinmiyor ancak Anthropic, bunların geniş ölçekte çalışabileceği en somut halka açık veri noktalarından birini sağladı. Yapay zekanın yazılım geliştirmeyi nasıl yeniden şekillendirdiğini takip eden okuyucular, daha fazla gelişme için yapay zeka araştırma kapsamımızı takip edebilir.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →