Anthropic telah menerbitkan laporan teknik terperinci tentang bagaimana hal itu membuat claude.ai dan aplikasi desktop Claude kira-kira tiga kali lebih cepat dalam sprint dua minggu, dan yang menarik adalah sebagian besar pekerjaan dilakukan oleh Claude sendiri. Postingan tersebut, yang dipublikasikan di blog teknik Anthropic, menjelaskan kampanye kinerja yang dijalankan dari satu saluran Slack dengan model AI di setiap thread, menemukan hambatan, membangun tolok ukur, melakukan peningkatan pengiriman, dan memantau setiap penerapan.
Angka-angka tersebut, yang diukur pada persentil ke-75, sangatlah besar. Waktu untuk mengetik halaman pada pemuatan baru claude.ai turun dari 3,1 detik menjadi 0,55 detik. Memulai sesi Claude Code baru turun dari 0,8 detik menjadi 0,3 detik, dan memuat sesi cloud Claude Cowork turun dari 2,6 detik menjadi 0,73 detik. Secara keseluruhan, Anthropic memperkirakan peningkatan ini menghemat puluhan ribu jam menunggu pengguna setiap hari. For more context on this story, see our ongoing artificial intelligence updates.
Mengukur terlebih dahulu, lalu memindahkannya
Sprint dimulai dengan pengukuran, bukan kode. Dengan menggunakan Claude untuk menganalisis data penggunaan melalui server Datadog MCP, tim mengidentifikasi empat perjalanan pengguna yang menyumbang 95 persen aktivitas: meluncurkan aplikasi, memulai percakapan, memuat percakapan yang ada, dan mengirim pesan. Di web dan desktop, perjalanan tersebut dipecah menjadi tiga belas pengukuran berbeda, dan tim menambahkan instrumentasi hingga masing-masing pengukuran dapat dibandingkan secara langsung — dimulai dari interaksi pengguna dan berakhir setelah hasilnya ditampilkan.
Dengan adanya garis dasar, tim menyusun daftar sekitar dua puluh proyek yang dipilih, masing-masing menargetkan perjalanan tertentu, dan meminta Claude memperkirakan dampak masing-masing proyek dalam hitungan milidetik untuk menetapkan target sprint. Rencana tersebut dilaksanakan lebih awal: Laporan antropik mencapai dua belas dari tiga belas target pada hari ketiga. Hal ini memberikan ruang bagi Claude untuk mengidentifikasi peluang lebih lanjut dan mengusulkan alur kerja baru, yang dengan cepat meningkatkan proyek mereka sendiri dan mendorong hasil melampaui tujuan awal.
Apa yang sebenarnya dikirimkan
Perubahan teknis terbaca seperti daftar periksa kinerja web modern. Untuk peluncuran yang lebih cepat, tim memasukkan komposer statis ke dalam HTML sehingga pengguna dapat mulai mengetik selama inisialisasi React, dan mengkompilasi cache kode V8 terlebih dahulu sehingga proses utama shell desktop tidak lagi dikompilasi ulang dari awal saat startup. Untuk navigasi yang lebih cepat di antara percakapan, komposer tetap terpasang dibandingkan dirobohkan dan dibangun kembali, sesi diambil terlebih dahulu ketika pengguna mengarahkan kursor ke atasnya, dan rendering ulang sidebar dipotong sebesar 90 persen.
Skala riwayat penggabungan adalah angka utama: lebih dari tiga ribu perubahan terjadi selama sprint tanpa satu pun insiden atau kemunduran yang dihadapi pelanggan, menurut postingan tersebut.
Claude Tag: agen dengan pagar pembatas
Sprint ini berjalan pada apa yang Anthropic sebut sebagai Claude Tag, saat ini dalam versi beta dan digambarkan sebagai model penelitian internal yang kira-kira sebanding dengan Opus 5.5. Pembagian kerja adalah bagian paling penting dari cerita ini. Claude menemukan hambatan, membuat tolok ukur, menerapkan perbaikan, dan memantau setiap penerapan — bekerja secara asinkron selama berjam-jam, bahkan dalam semalam. Manusia menetapkan tujuan, membuat pengorbanan, dan menyetujui setiap perubahan sebelum digabungkan.
Tim juga ingin melakukan iterasi lebih cepat daripada irama penerapannya, sehingga mereka membuat pengukuran laboratorium sebagai proksi untuk pembacaan di dunia nyata. Di antara pertanyaan yang diajukan para insinyur: dapatkah jumlah instruksi JavaScript menggantikan waktu jam dinding sebagai sinyal umpan balik yang lebih cepat untuk memvalidasi prototipe sebelum penerapan?
Mengapa hal ini penting bagi rekayasa yang dibantu AI
Postingan Anthropic kurang menonjol karena pengoptimalan spesifiknya — shell statis, pengambilan awal, dan pengurangan render adalah teknik yang sudah ada — dibandingkan dengan apa yang ditunjukkannya tentang pengembangan berbasis AI pada skala produksi. Sebuah laboratorium terdepan baru saja melakukan perombakan kinerja sebanyak tiga ribu perubahan pada produk konsumen unggulan dengan agen AI yang melakukan sebagian besar pekerjaan identifikasi, implementasi, dan verifikasi, sementara manusia tetap memiliki otoritas persetujuan atas setiap perubahan.
Hasilnya juga muncul dalam konteks kompetitif di mana daya tanggap merupakan fitur produk. Claude bersaing langsung dengan ChatGPT OpenAI dan Gemini Google untuk mendapatkan perhatian konsumen dan pengembang, dan kecepatan yang dirasakan membentuk penggunaan produk asisten sehari-hari seperti halnya kualitas model. Memotong waktu menjadi interaktif dari 3,1 detik menjadi 0,55 detik mengatasi satu-satunya keluhan paling umum yang dimiliki pengguna tentang produk.
Bagi tim teknik yang mengawasi dari luar, pelajaran yang dapat diambil dari akun Anthropic adalah struktur loop: mengukur perjalanan pengguna dengan tepat, membiarkan model mengusulkan dan memvalidasi perubahan terhadap pengukuran tersebut, menjaga gerbang persetujuan manusia, dan memperluas cakupan hanya secepat yang dapat diverifikasi oleh sistem pengukuran. Pembingkaian Anthropic sendiri adalah ketika Claude dapat mengukur sesuatu, ia dapat membuatnya lebih cepat — sehingga tim terus menemukan lebih banyak hal untuk diukur.
Masih harus dilihat apakah sprint berbasis agen serupa akan menjadi praktik standar di industri perangkat lunak, namun Anthropic telah memberikan salah satu poin data publik paling konkret yang dapat digunakan dalam skala besar. Pembaca yang melacak bagaimana AI membentuk kembali pengembangan perangkat lunak dapat mengikuti liputan penelitian AI kami untuk pengembangan lebih lanjut.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →