Anthropic telah menerbitkan akaun kejuruteraan terperinci tentang cara ia membuat claude.ai dan apl desktop Claude kira-kira tiga kali lebih pantas dalam pecutan dua minggu, dan kelainannya ialah kebanyakan kerja itu dilakukan oleh Claude sendiri. Siaran itu, yang diterbitkan di blog kejuruteraan Anthropic, menerangkan kempen prestasi yang dijalankan daripada saluran Slack tunggal dengan model AI dalam setiap urutan, mencari kesesakan, membina penanda aras, penambahbaikan penghantaran dan menonton setiap penggunaan.
Nombor, diukur pada persentil ke-75, adalah besar. Masa ke halaman boleh taip pada muatan baru claude.ai jatuh daripada 3.1 saat kepada 0.55 saat. Memulakan sesi Claude Code baharu menurun daripada 0.8 saat kepada 0.3 saat, dan memuatkan sesi awan Claude Cowork turun daripada 2.6 saat kepada 0.73 saat. Secara agregat, Anthropic menganggarkan penambahbaikan menjimatkan puluhan ribu jam pengguna menunggu setiap hari. For more context on this story, see our ongoing more AI stories.
Mengukur dahulu, kemudian bergerak
Larian pecut bermula dengan pengukuran dan bukannya kod. Menggunakan Claude untuk menganalisis data penggunaan melalui pelayan MCP Datadog, pasukan itu mengenal pasti empat perjalanan pengguna yang menyumbang 95 peratus aktiviti: melancarkan apl, memulakan perbualan, memuatkan perbualan sedia ada dan menghantar mesej. Di seluruh web dan desktop, perjalanan tersebut dipecahkan kepada tiga belas ukuran yang berbeza, dan pasukan menambah instrumentasi sehingga setiap satunya adalah setanding secara langsung — bermula pada interaksi pengguna dan berakhir sebaik sahaja keputusan dipaparkan.
Dengan garis dasar disediakan, pasukan itu merangka senarai kira-kira dua puluh projek yang dipilih sendiri, setiap satu menyasarkan perjalanan tertentu dan meminta Claude menganggarkan kesan setiap satu dalam milisaat untuk menetapkan sasaran pecut. Pelan itu mendarat awal: Laporan Anthropic mencapai dua belas daripada tiga belas sasaran menjelang hari ketiga. Itu memberi ruang kepada Claude untuk mengenal pasti peluang selanjutnya dan mencadangkan aliran kerja baharu, yang dengan pantas mencecah projek penuh mereka sendiri dan mendorong keputusan melebihi matlamat asal.
Apa yang sebenarnya dihantar
Perubahan teknikal berbunyi seperti senarai semak kerja prestasi web moden. Untuk pelancaran yang lebih pantas, pasukan itu memasukkan komposer statik ke dalam HTML supaya pengguna boleh mula menaip semasa permulaan React, dan menyusun cache kod V8 terlebih dahulu supaya proses utama shell desktop tidak lagi menyusun semula dari awal semasa permulaan. Untuk navigasi yang lebih pantas antara perbualan, komposer kekal dipasang dan bukannya dirobohkan dan dibina semula, sesi diambil semula apabila pengguna melayang di atasnya dan pemaparan semula bar sisi dipotong sebanyak 90 peratus.
Skala sejarah penggabungan ialah angka tajuk utama: lebih daripada tiga ribu perubahan berlaku semasa pecut tanpa satu insiden atau pengembalian yang dihadapi pelanggan, menurut siaran itu.
Claude Tag: ejen dengan pagar
Pecutan berjalan pada apa yang Anthropic panggil Claude Tag, kini dalam versi beta dan digambarkan sebagai model penyelidikan dalaman secara kasarnya setanding dengan Opus 5.5. Pembahagian kerja adalah bahagian yang paling penting dalam cerita. Claude menemui kesesakan, membina penanda aras, melaksanakan pembetulan dan memantau setiap penggunaan — bekerja secara tidak segerak selama berjam-jam pada satu masa, walaupun dalam sekelip mata. Manusia menetapkan matlamat, membuat pertukaran, dan meluluskan setiap perubahan sebelum ia bergabung.
Pasukan itu juga mahu melelang lebih cepat daripada irama penggunaannya, jadi ia membina pengukuran makmal sebagai proksi untuk bacaan dunia sebenar. Antara soalan yang ditanya oleh jurutera: bolehkah kiraan arahan JavaScript menggantikan pemasaan jam dinding sebagai isyarat maklum balas yang lebih pantas untuk mengesahkan prototaip sebelum penggunaan?
Mengapa ia penting untuk kejuruteraan berbantukan AI
Siaran Anthropic kurang ketara untuk pengoptimuman khusus — cengkerang statik, prefetching dan pengurangan render adalah teknik yang telah ditetapkan — berbanding apa yang ditunjukkannya tentang pembangunan dipacu AI pada skala pengeluaran. Makmal sempadan baru sahaja menghantar rombakan prestasi tiga ribu perubahan bagi produk pengguna utama dengan ejen AI melakukan sebahagian besar kerja pengenalpastian, pelaksanaan dan pengesahan, manakala manusia mengekalkan kuasa kelulusan ke atas setiap perubahan.
Hasilnya juga berada dalam konteks yang kompetitif di mana responsif adalah ciri produk. Claude bersaing secara langsung dengan OpenAI's ChatGPT dan Google Gemini untuk perhatian pengguna dan pembangun, dan kelajuan yang dirasakan membentuk penggunaan harian produk pembantu sama seperti kualiti model. Pemotongan masa kepada interaktif daripada 3.1 saat kepada 0.55 saat menangani satu-satunya aduan yang paling biasa dialami pengguna tentang produk.
Untuk pasukan kejuruteraan yang menonton dari luar, pengajaran yang boleh dipindahkan daripada akaun Anthropic ialah struktur gelung: ukur perjalanan pengguna dengan tepat, biarkan model mencadangkan dan mengesahkan perubahan terhadap ukuran tersebut, mengekalkan pintu kelulusan manusia dan mengembangkan skop hanya secepat yang boleh disahkan oleh sistem pengukuran. Pembingkaian Anthropic sendiri ialah apabila Claude dapat mengukur sesuatu, ia boleh menjadikannya lebih pantas — jadi pasukan itu terus mencari lebih banyak perkara untuk diukur.
Sama ada larian pecut dipacu ejen yang serupa menjadi amalan standard merentas industri perisian masih belum dapat dilihat, tetapi Anthropic telah menyediakan salah satu titik data awam yang paling konkrit lagi yang boleh berfungsi pada skala. Pembaca yang menjejaki cara AI membentuk semula pembangunan perisian boleh mengikuti liputan penyelidikan AI kami untuk perkembangan selanjutnya.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →