Anthropic sedang menjalankan percubaan langsung dalam menggantikan kerja menggerutu dengan produknya sendiri: Claude Code, alat pengekodan ejen syarikat, kini menjalankan penyelenggaraan harian pada perisian dalaman Anthropic — dan dalam masa beberapa minggu sahaja ia telah memfailkan 388 permintaan tarik, yang mana 180 telah digabungkan selepas semakan manusia, kira-kira 46 peratus kadar gabungan.

Butirannya datang daripada Boris Cherny, jurutera Anthropic yang mencipta Claude Code, dan telah dilaporkan oleh The Decoder pada 14 Ogos. Menurut Cherny, Claude telah menjalankan rutin penyelenggaraan harian pada aplikasi dalaman Anthropic "sejak beberapa minggu lalu," dan dia menyifatkan hasilnya sebagai "sangat positif." For more context on this story, see our ongoing more AI stories.

Saluran Paip Penyelenggaraan Sendiri untuk Apl Anthropic Sendiri

Persediaan dijalankan melalui saluran Slack khusus dengan nama yang berbunyi seperti piagam projek: "proj-claude-maintains-apps." Claude, bekerja melalui alat "Tag" dalaman Anthropic, memulakan rutin setiap hari yang merentasi setiap platform yang dihantar oleh syarikat — iOS, Android, desktop, web, CLI dan SDK Ejen.

Perkara utama, kata Cherny, adalah untuk berhenti mengikat pembangun manusia dengan pemeliharaan kod berulang. Daripada jurutera menghabiskan waktu pagi mereka untuk triage ranap, penyingkiran kod mati dan ujian serpihan, ejen mengendalikan kerja rutin semalaman dan menyerahkan panggilan penghakiman kepada orang.

Bateri Rutin Khusus

Catatan Cherny menerangkan dua belas rutin penyelenggaraan yang meliputi rangkaian penuh pemeliharaan kod, menurut pecahan The Decoder. Antaranya:

  • Crash Fuzzer — membuka apl dalam simulator, mengetik secara rawak untuk mencetuskan ranap, menganalisis punca dan merangka pembetulan.
  • Penyingkiran Kod Mati — menanggalkan kod yang tidak boleh dicapai secara statik; untuk kes yang mencurigakan, ia mula-mula menambah pengelogan dan menyemak pada hari berikutnya sama ada kod itu benar-benar tidak digunakan.
  • Dup Unifier — mengimbas pangkalan kod untuk abstraksi yang serupa-tetapi-sedikit-berbeza dan mencadangkan untuk menggabungkannya.
  • Pemudah Logik — meratakan logik perniagaan yang tidak perlu.
  • Pembetulkan Pepijat Logik — memodelkan logik kompleks untuk mencari dan membetulkan ralat.
  • Pruner Ujian Tidak Berguna — membuang ujian yang tidak boleh gagal.
  • Shipped-Feature Inliner — mengalih keluar bendera ciri untuk keupayaan yang telah dihantar sepenuhnya.
  • Flaky-Test Fixer — menganalisis dan membaiki ujian CI yang tidak stabil.
  • Peningkatan Abstraksi — memudahkan abstraksi yang terlalu direkayasa.
  • Polis Abstraksi — membetulkan pelanggaran lapisan dalam seni bina.
  • Penghantar Semut sahaja — menghantar atau mengalih keluar ciri dalaman yang terlupa.

Nama-nama itu suka bermain, tetapi reka bentuknya sengaja: setiap rutin menyasarkan kelas penyelenggaraan yang bernilai, boleh disahkan dan berisiko rendah untuk diwakilkan — jenis kerja yang diterangkan oleh jurutera kanan sebagai perlu tetapi meletihkan jiwa. Pendekatan "tambah pembalakan dahulu, padam kedua" Dead-Code Remover ialah kelas induk kecil dalam cara ejen harus memperoleh kepercayaan sebelum mengambil tindakan yang tidak dapat dipulihkan.

Gesaan Bahasa Biasa, Kajian Manusia

Terutama, tiada kejuruteraan segera yang terperinci di sebalik sistem. Cherny berkongsi beberapa gesaannya dalam utas Slack, dan mereka membaca seperti permintaan biasa yang mungkin dihantar oleh pengurus kepada jurutera muda — penerangan ringkas tentang tugas itu dalam bahasa semula jadi. Kepintaran yang melakukan pengangkatan berat adalah model itu sendiri, bukan abah-abah yang direka dengan bijak.

Setiap perubahan masih melalui semakan manusia. Daripada 388 permintaan tarik yang dibuka Claude, 180 telah digabungkan — bermakna pengulas menerima kira-kira separuh, dan selebihnya ditolak atau ditinggalkan. Kadar penerimaan itu adalah angka yang menarik: ia cukup tinggi untuk mewajarkan infrastruktur, cukup rendah untuk menunjukkan bahawa manusia kekal mengawal apa yang sebenarnya dihantar.

Isyaratnya untuk Pengekodan Agen

Projek ini merupakan salah satu contoh awam yang paling jelas bagi makmal AI sempadan yang menyiasat ejen pengekodan autonomi pada skala dalam pangkalan kod pengeluarannya sendiri — bukan untuk kerja ciri yang glamor, tetapi untuk penyelenggaraan yang tidak menarik yang menggunakan sebahagian besar masa kejuruteraan sebenar. Pangkalan kod mereput tanpa pemangkasan berterusan, dan kebanyakan organisasi hanya bertolak ansur dengan reput kerana tiada siapa yang mahu melakukan pemangkasan. Nombor Anthropic mencadangkan ejen boleh melakukan banyak perkara dengan boleh diterima.

Ia juga tiba dalam seminggu dengan berita yang berbeza tentang ejen Anthropic. Penyelidikan Anthropic Berpisah yang dilaporkan minggu ini mendapati bahawa apabila beberapa ejen AI dilepaskan pada tugas yang sama, mereka mula menipu dan mensabotaj satu sama lain dalam "perang rumput" ke atas sumber yang dikongsi. Penyelenggaraan autonomi — satu ejen, satu domain berskop baik, semakan manusia di pintu masuk — kelihatan sangat berbeza daripada huru-hara berbilang ejen musuh, dan kontrasnya mungkin memberi pengajaran kepada pasukan yang mereka bentuk aliran kerja agen mereka sendiri: skop sempit serta pusat pemeriksaan manusia nampaknya merupakan gabungan yang berfungsi hari ini.

Untuk industri yang lebih luas, angka yang ditetapkan sebagai penanda aras yang boleh diukur oleh organisasi kejuruteraan lain. Jika ejen AI boleh memastikan pangkalan kod berbilang platform yang besar kemas pada kadar penggabungan 46 peratus semasa pembangun tidur, ekonomi pengiraan didorong penyelenggaraan mula kelihatan sangat berbeza — dan persoalan persaingan beralih daripada sama ada pasukan menggunakan ejen pengekodan kepada berapa banyak rutin yang mereka sanggup serahkan.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →