آنتروپیک در حال اجرای آزمایشی زنده برای جایگزینی کار غرغر با محصول خود است: Claude Code، ابزار کدنویسی عامل شرکت، اکنون تعمیر و نگهداری روزانه را بر روی نرم افزار داخلی آنتروپیک انجام می دهد - و تنها در چند هفته 388 درخواست کشش ارائه کرده است که از این تعداد 180 مورد پس از بررسی انسانی ادغام شدند، یعنی تقریباً 46 درصد نرخ ادغام.

جزئیات از بوریس چرنی، مهندس Anthropic که Claude Code را ایجاد کرده است، و توسط The Decoder در 14 اوت گزارش شده است. به گفته چرنی، کلود در چند هفته گذشته روال تعمیر و نگهداری روزانه را در برنامه های داخلی Anthropic اجرا کرده است و او نتایج را "به طرز شگفت انگیزی مثبت" توصیف می کند. For more context on this story, see our ongoing AI news.

خط لوله خودنگهداری برای برنامه های خود Anthropic

راه‌اندازی از طریق یک کانال اختصاصی Slack با نامی که مانند منشور پروژه خوانده می‌شود اجرا می‌شود: «proj-claude-maintains-apps». کلود که از طریق ابزار داخلی Anthropic "Tag" کار می کند، هر روز روال هایی را آغاز می کند که در تمام پلتفرم هایی که شرکت ارائه می دهد - iOS، Android، دسکتاپ، وب، CLI، و Agent SDK را فرا می گیرد.

چرنی می‌گوید، هدف این است که از ایجاد ارتباط با توسعه‌دهندگان انسانی با نگهداری کد تکراری خودداری کنیم. به جای اینکه مهندسان صبح خود را صرف تریاژ تصادف، حذف کد مرده، و تست های پوسته پوسته کنند، مامور یک شبه کار معمول را انجام می دهد و قضاوت را به مردم واگذار می کند.

باتری از روتین های تخصصی

پست چرنی دوازده روال نگهداری را تشریح می‌کند که طیف کاملی از نگهداری کد را پوشش می‌دهد، طبق تفکیک The Decoder. از جمله:

  • Crash Fuzzer - برنامه ها را در یک شبیه ساز باز می کند، به طور تصادفی به اطراف ضربه می زند تا باعث خرابی شود، علت اصلی را تجزیه و تحلیل می کند و یک راه حل را تهیه می کند.
  • Dead-Code Remover - کدهای غیرقابل دسترس را حذف می کند. برای موارد مشکوک، ابتدا ورود به سیستم را اضافه می کند و روز بعد بررسی می کند که آیا کد واقعاً استفاده نشده است یا خیر.
  • Dup Unifier - پایگاه کد را برای انتزاعات مشابه اما کمی متفاوت اسکن می کند و ادغام آنها را پیشنهاد می کند.
  • ساده ساز منطق - منطق تجاری تو در تو را صاف می کند.
  • رفع اشکال منطقی - منطق پیچیده را برای یافتن و رفع خطاها مدل می کند.
  • بی فایده تست هرس - تست هایی را که هرگز نمی توانند شکست بخورند حذف می کند.
  • Inliner با ویژگی ارسال شده - پرچم های ویژگی را برای قابلیت هایی که قبلاً به طور کامل ارسال شده اند حذف می کند.
  • Flaky-Test Fixer - تست های CI ناپایدار را تجزیه و تحلیل و تعمیر می کند.
  • بهبود انتزاع - انتزاعات مهندسی شده را ساده می کند.
  • پلیس انتزاعی - نقض لایه ها در معماری را برطرف می کند.
  • ارسال کننده فقط مورچه - ویژگی های داخلی فراموش شده را ارائه یا حذف می کند.

نام‌ها بازیگوش هستند، اما طراحی عمدی است: هر روال، طبقه‌ای از تعمیر و نگهداری را هدف قرار می‌دهد که برای واگذاری آن ارزشمند، قابل تأیید و کم خطر است - کاری که مهندسان ارشد آن را ضروری اما خسته‌کننده توصیف می‌کنند. رویکرد Dead-Code Remover "اول اضافه کردن گزارش، دوم حذف" یک استاد کلاس کوچک در این است که چگونه یک عامل باید قبل از اقدام غیرقابل برگشت اعتماد کسب کند.

درخواست‌های زبان ساده، بررسی انسانی

قابل ذکر است، هیچ مهندسی سریع دقیقی در پشت سیستم وجود ندارد. چرنی برخی از درخواست‌های خود را در تاپیک Slack به اشتراک گذاشت، و آنها مانند درخواست‌های معمولی خواندند که یک مدیر ممکن است برای یک مهندس جوان بفرستد - توصیف ساده کار به زبان طبیعی. هوشی که در بلند کردن اجسام سنگین انجام می شود خود مدل است، نه یک مهار هوشمندانه مهندسی شده.

هر تغییری هنوز از طریق بازبینی انسانی می گذرد. از 388 درخواست کششی که کلود باز کرد، 180 مورد ادغام شدند - به این معنی که بازبینان تقریباً نیمی را پذیرفتند و بقیه رد یا رها شدند. این نرخ پذیرش عدد جالبی است: به اندازه‌ای بالاست که زیرساخت‌ها را توجیه کند، به اندازه‌ای پایین است که نشان دهد انسان‌ها به‌طور قاطعانه کنترل کشتی‌های واقعی را در دست دارند.

برای کدنویسی عامل چه سیگنالی دارد

این پروژه یکی از واضح‌ترین نمونه‌های عمومی از آزمایشگاه هوش مصنوعی مرزی است که یک عامل کدگذاری مستقل را در مقیاس درون پایگاه کد تولیدی خود آزمایش می‌کند – نه برای کار با ویژگی‌های جذاب، بلکه برای تعمیر و نگهداری غیر جذاب که سهم زیادی از زمان مهندسی واقعی را مصرف می‌کند. پایگاه های کد بدون هرس مداوم پوسیده می شوند و بیشتر سازمان ها پوسیدگی را تحمل می کنند زیرا هیچ کس نمی خواهد هرس را انجام دهد. اعداد آنتروپیک نشان می دهد که یک نماینده می تواند بسیاری از این کارها را به طور قابل قبولی انجام دهد.

همچنین در یک هفته اخبار متضاد درباره عوامل آنتروپیک منتشر می شود. تحقیقات جداگانه Anthropic که در این هفته گزارش شد نشان داد که وقتی چندین عامل هوش مصنوعی در یک کار آزاد شدند، آنها شروع به فریب دادن و خرابکاری یکدیگر در یک "جنگ چمن" بر سر منابع مشترک کردند. تعمیر و نگهداری مستقل - یک عامل، یک دامنه با محدوده خوب، بررسی انسانی در دروازه - به نظر بسیار متفاوت از هرج و مرج چند عامله متخاصم است، و تضاد ممکن است برای تیم هایی که گردش کار عاملی خود را طراحی می کنند آموزنده باشد: به نظر می رسد محدوده باریک به علاوه نقاط بازرسی انسانی ترکیبی باشد که امروزه کار می کند.

برای صنعت گسترده‌تر، این اعداد معیاری را برای سایر سازمان‌های مهندسی تعیین می‌کنند. اگر یک عامل هوش مصنوعی بتواند یک پایگاه کد چند پلتفرمی بزرگ را با نرخ 46 درصد ادغام در زمانی که توسعه‌دهندگان خواب هستند، مرتب نگه دارد، وضعیت اقتصادی تعداد کارمندان مبتنی بر تعمیر و نگهداری بسیار متفاوت به نظر می‌رسد – و سوال رقابتی از این که آیا تیم‌ها از عوامل کدنویسی استفاده می‌کنند تا چه مقدار از کارهای معمولی که می‌خواهند تحویل دهند تغییر می‌کند.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →