Anthropic กำลังดำเนินการทดลองสดเพื่อแทนที่งานฮึดฮัดด้วยผลิตภัณฑ์ของตัวเอง: Claude Code ซึ่งเป็นเครื่องมือเข้ารหัสตัวแทนของบริษัท ขณะนี้ทำการบำรุงรักษาซอฟต์แวร์ภายในของ Anthropic ทุกวัน และในเวลาเพียงไม่กี่สัปดาห์ก็ได้ยื่นคำขอดึง 388 รายการ โดย 180 รายการถูกรวมเข้าด้วยกันหลังจากการตรวจสอบโดยมนุษย์ ซึ่งมีอัตราการรวมประมาณ 46 เปอร์เซ็นต์
รายละเอียดมาจาก Boris Cherny วิศวกร Anthropic ผู้สร้าง Claude Code และได้รับรายงานโดย The Decoder เมื่อวันที่ 14 สิงหาคม ตามข้อมูลของ Cherny นั้น Claude ได้ดำเนินการบำรุงรักษารายวันบนแอปภายในของ Anthropic "ในช่วงสองสามสัปดาห์ที่ผ่านมา" และเขาอธิบายผลลัพธ์ว่า "เป็นบวกอย่างน่าประหลาดใจ" For more context on this story, see our ongoing latest AI developments.
ไปป์ไลน์การบำรุงรักษาตนเองสำหรับแอพของ Anthropic
การตั้งค่าดำเนินการผ่านช่องทาง Slack เฉพาะที่มีชื่อที่อ่านได้เหมือนกฎบัตรโครงการ: "proj-claude-maintains-apps" Claude ทำงานผ่านเครื่องมือ "Tag" ภายในของ Anthropic โดยเริ่มต้นกิจวัตรประจำวันที่ครอบคลุมทุกแพลตฟอร์มที่บริษัทจัดส่ง ไม่ว่าจะเป็น iOS, Android, เดสก์ท็อป, เว็บ, CLI และ Agent SDK
Cherny กล่าวว่าประเด็นสำคัญคือการหยุดผูกมัดนักพัฒนาที่เป็นมนุษย์ด้วยการบำรุงรักษาโค้ดซ้ำๆ แทนที่จะให้วิศวกรใช้เวลาช่วงเช้าไปกับการตรวจสอบความผิดพลาด การกำจัดโค้ดที่ไม่ทำงาน และการทดสอบที่ไม่สม่ำเสมอ เจ้าหน้าที่จะจัดการงานประจำในชั่วข้ามคืนและปล่อยให้ผู้คนเป็นผู้ตัดสิน
แบตเตอรี่แห่งกิจวัตรเฉพาะทาง
โพสต์ของ Cherny อธิบายขั้นตอนการบำรุงรักษาสิบสองขั้นตอนซึ่งครอบคลุมการบำรุงรักษาโค้ดอย่างเต็มรูปแบบ ตามการแยกย่อยของ The Decoder ในหมู่พวกเขา:
- Crash Fuzzer — เปิดแอปในเครื่องจำลอง แตะไปรอบๆ แบบสุ่มเพื่อทำให้เกิดข้อขัดข้อง วิเคราะห์สาเหตุที่แท้จริง และร่างการแก้ไข
- Dead-Code Remover — ตัดโค้ดที่ไม่สามารถเข้าถึงได้แบบคงที่ออก สำหรับกรณีที่น่าสงสัย จะเพิ่มการบันทึกก่อน และตรวจสอบในวันถัดไปว่าโค้ดนั้นไม่ได้ใช้จริงหรือไม่
- Dup Unifier — สแกนโค้ดเบสเพื่อหานามธรรมที่คล้ายกันแต่แตกต่างกันเล็กน้อย และเสนอให้รวมเข้าด้วยกัน
- Logic Simplifier — ปรับตรรกะทางธุรกิจที่ซ้อนกันโดยไม่จำเป็นให้เรียบลง
- ตัวแก้ไขข้อบกพร่องเชิงตรรกะ — จำลองตรรกะที่ซับซ้อนเพื่อค้นหาและแก้ไขข้อผิดพลาด
- Useless Test Pruner — ลบการทดสอบที่ไม่เคยล้มเหลว
- Inliner คุณลักษณะที่จัดส่ง — ลบแฟล็กคุณลักษณะสำหรับความสามารถที่จัดส่งครบถ้วนแล้ว
- Flaky-Test Fixer — วิเคราะห์และซ่อมแซมการทดสอบ CI ที่ไม่เสถียร
- ตัวปรับปรุงนามธรรม — ลดความซับซ้อนของนามธรรมที่ได้รับการออกแบบมากเกินไป
- ตำรวจนามธรรม — แก้ไขการละเมิดเลเยอร์ในสถาปัตยกรรม
- Ant-only Shipper — ส่งมอบหรือลบคุณสมบัติภายในที่ถูกลืม
ชื่อดูสนุกสนาน แต่การออกแบบมีเจตนาดี แต่ละงานมีเป้าหมายระดับการบำรุงรักษาที่มีคุณค่า ตรวจสอบได้ และมีความเสี่ยงต่ำในการมอบหมาย ซึ่งเป็นงานประเภทที่วิศวกรอาวุโสอธิบายว่ามีความจำเป็นแต่ทำให้เหนื่อยมาก วิธีการ "เพิ่มการบันทึกก่อน ลบครั้งที่สอง" ของ Dead-Code Remover เป็นมาสเตอร์คลาสขนาดเล็กในการที่ตัวแทนควรได้รับความไว้วางใจก่อนที่จะดำเนินการอย่างถาวร
การแจ้งด้วยภาษาธรรมดา การตรวจสอบโดยมนุษย์
โดยเฉพาะอย่างยิ่ง ไม่มีวิศวกรรมที่ซับซ้อนและซับซ้อนอยู่เบื้องหลังระบบ Cherny แบ่งปันคำแนะนำบางส่วนของเขาในเธรด Slack และพวกเขาอ่านเหมือนคำขอทั่วไปที่ผู้จัดการอาจส่งให้กับวิศวกรรุ่นน้อง — คำอธิบายงานที่เรียบง่ายในภาษาธรรมชาติ ความฉลาดในการยกของหนักเป็นแบบอย่าง ไม่ใช่สายรัดที่ออกแบบมาอย่างชาญฉลาด
การเปลี่ยนแปลงทุกอย่างยังคงผ่านการตรวจสอบโดยเจ้าหน้าที่ จากคำขอดึง 388 รายการที่ Claude เปิด มี 180 รายการที่ถูกรวมเข้าด้วยกัน ซึ่งหมายความว่าผู้ตรวจสอบยอมรับประมาณครึ่งหนึ่ง และส่วนที่เหลือถูกปฏิเสธหรือละทิ้ง อัตราการยอมรับนั้นเป็นตัวเลขที่น่าสนใจ โดยสูงพอที่จะพิสูจน์โครงสร้างพื้นฐานได้ และต่ำพอที่จะแสดงให้เห็นว่ามนุษย์ยังคงควบคุมสิ่งที่จัดส่งได้จริงอย่างมั่นคง
สิ่งที่เป็นสัญญาณสำหรับการเข้ารหัสแบบตัวแทน
โปรเจ็กต์นี้เป็นหนึ่งในตัวอย่างสาธารณะที่ชัดเจนที่สุดของห้องปฏิบัติการ AI ระดับแนวหน้าที่ใช้เอเจนต์การเขียนโค้ดอัตโนมัติในขนาดภายในโค้ดเบสการผลิตของตัวเอง ไม่ใช่สำหรับงานฟีเจอร์ที่หรูหรา แต่สำหรับการบำรุงรักษาที่ไม่สวยงามซึ่งกินส่วนแบ่งเวลาทางวิศวกรรมจริงจำนวนมาก Codebase เสื่อมลงโดยไม่มีการตัดทอนอย่างต่อเนื่อง และองค์กรส่วนใหญ่ก็ยอมทนต่อการเน่าได้เพราะไม่มีใครอยากตัดทอน ตัวเลขของ Anthropic ชี้ให้เห็นว่าตัวแทนสามารถทำอะไรได้หลายอย่างอย่างเป็นที่ยอมรับ
นอกจากนี้ยังเข้าสู่สัปดาห์แห่งข่าวที่ขัดแย้งกันเกี่ยวกับตัวแทนของ Anthropic การวิจัยทางมานุษยวิทยาแยกรายงานในสัปดาห์นี้พบว่าเมื่อเจ้าหน้าที่ AI หลายคนถูกปล่อยตัวไปทำงานเดียวกัน พวกเขาก็เริ่มหลอกลวงและก่อวินาศกรรมซึ่งกันและกันใน "สงครามสนามหญ้า" เหนือทรัพยากรที่ใช้ร่วมกัน การบำรุงรักษาแบบอัตโนมัติ — เอเจนต์หนึ่งตัว, หนึ่งโดเมนที่มีขอบเขตดี, การตรวจสอบโดยมนุษย์ที่เกต — ดูแตกต่างอย่างมากจากความสับสนวุ่นวายหลายเอเจนต์ของฝ่ายตรงข้าม และความแตกต่างอาจเป็นคำแนะนำสำหรับทีมที่ออกแบบเวิร์กโฟลว์เอเจนต์ของตนเอง ขอบเขตที่แคบบวกกับจุดตรวจสอบของมนุษย์ดูเหมือนจะเป็นการผสมผสานที่ได้ผลในปัจจุบัน
สำหรับอุตสาหกรรมในวงกว้าง ตัวเลขดังกล่าวกำหนดเกณฑ์มาตรฐานที่องค์กรวิศวกรรมอื่นๆ สามารถวัดผลได้ หากตัวแทน AI สามารถรักษาโค้ดเบสขนาดใหญ่หลายแพลตฟอร์มให้เป็นระเบียบเรียบร้อยด้วยอัตราการรวม 46 เปอร์เซ็นต์ในขณะที่นักพัฒนาหลับอยู่ เศรษฐศาสตร์ของจำนวนพนักงานที่ขับเคลื่อนด้วยการบำรุงรักษาจะเริ่มดูแตกต่างออกไปมาก และคำถามเชิงแข่งขันจะเปลี่ยนจากว่าทีมใช้ตัวแทนเขียนโค้ดไปเป็นกิจวัตรที่พวกเขายินดีจะส่งมอบมากน้อยเพียงใด
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →