تجري Anthropic تجربة حية لاستبدال العمل الناخر بمنتجها الخاص: تقوم Claude Code، أداة التشفير التابعة للشركة، الآن بإجراء صيانة يومية لبرامج Anthropic الداخلية - وفي غضون أسابيع قليلة قدمت 388 طلب سحب، تم دمج 180 منها بعد مراجعة بشرية، أي معدل دمج يبلغ 46 بالمائة تقريبًا.

تأتي التفاصيل من بوريس تشيرني، المهندس الأنثروبي الذي ابتكر كلود كود، وتم الإبلاغ عنها بواسطة The Decoder في 14 أغسطس. وفقًا لشيرني، كان كلود يدير إجراءات الصيانة اليومية لتطبيقات Anthropic الداخلية "على مدى الأسابيع القليلة الماضية"، ويصف النتائج بأنها "إيجابية بشكل مدهش". لمزيد من السياق حول هذه القصة، راجع تغطية صناعة الذكاء الاصطناعي.

خط أنابيب للصيانة الذاتية للتطبيقات البشرية الخاصة

يتم تشغيل الإعداد من خلال قناة Slack مخصصة باسم يشبه ميثاق المشروع: "proj-claude-maintains-apps". يبدأ كلود، الذي يعمل من خلال أدوات "العلامة" الداخلية في Anthropic، الإجراءات الروتينية كل يوم والتي تكتسح كل منصة تشحنها الشركة - iOS، وAndroid، وسطح المكتب، والويب، وCLI، وAgent SDK.

يقول تشيرني إن الهدف هو التوقف عن تقييد المطورين البشريين بصيانة التعليمات البرمجية المتكررة. فبدلاً من قضاء المهندسين صباحهم في فرز الأعطال، وإزالة التعليمات البرمجية الميتة، والاختبارات غير المستقرة، يتولى الوكيل العمل الروتيني بين عشية وضحاها ويترك قرارات الحكم للناس.

بطارية من الإجراءات الروتينية المتخصصة

يصف منشور Cherny اثني عشر إجراء صيانة يغطي النطاق الكامل لصيانة التعليمات البرمجية، وفقًا لتفاصيل The Decoder. من بينها:

  • Crash Fuzzer — يفتح التطبيقات في جهاز محاكاة، وينقر بشكل عشوائي لإثارة الأعطال، ويحلل السبب الجذري، ويضع مسودة للإصلاح.
  • Dead-Code Remover — يزيل التعليمات البرمجية التي لا يمكن الوصول إليها بشكل ثابت؛ بالنسبة للحالات المشبوهة، يقوم أولاً بإضافة التسجيل والتحقق في اليوم التالي مما إذا كان الرمز غير مستخدم حقًا.
  • Dup Unifier — يقوم بمسح قاعدة التعليمات البرمجية بحثًا عن تجريدات متشابهة ولكن مختلفة قليلاً ويقترح دمجها.
  • Logic Simplifier — يعمل على تسطيح منطق الأعمال المتداخل دون داع.
  • Logic Bug Fixer — نماذج منطقية معقدة للعثور على الأخطاء وإصلاحها.
  • مقلم الاختبار عديم الفائدة — يزيل الاختبارات التي لا يمكن أن تفشل أبدًا.
  • Shipped-Feature Inliner — يزيل علامات الميزات للإمكانيات التي تم شحنها بالكامل بالفعل.
  • Flaky-Test Fixer — يحلل ويصلح اختبارات CI غير المستقرة.
  • مُحسِّن التجريد — يبسط التجريدات المفرطة في الهندسة.
  • شرطة التجريد — تعمل على إصلاح انتهاكات الطبقة في البنية.
  • Ant-only Shipper — يقوم بتوصيل أو إزالة الميزات الداخلية المنسية.

الأسماء مرحة، ولكن التصميم متعمد: كل روتين يستهدف فئة من الصيانة ذات قيمة، ويمكن التحقق منها، ومنخفضة المخاطر للتفويض - وهو نوع العمل الذي يصفه كبار المهندسين بأنه ضروري ولكنه يستنزف الروح. يُعد أسلوب Dead-Code Remover "إضافة التسجيل أولاً، والحذف ثانيًا" درسًا رئيسيًا صغيرًا حول كيفية اكتساب الوكيل الثقة قبل اتخاذ إجراء لا رجعة فيه.

مطالبات باللغة البسيطة، مراجعة بشرية

والجدير بالذكر أنه لا توجد هندسة سريعة ومتقنة وراء النظام. شارك تشيرني بعضًا من مطالباته في موضوع Slack، وكانت تبدو مثل الطلبات العادية التي قد يرسلها المدير إلى مهندس مبتدئ - فهي عبارة عن أوصاف واضحة للمهمة باللغة الطبيعية. إن الذكاء الذي يقوم برفع الأحمال الثقيلة هو النموذج نفسه، وليس الحزام المصمم بذكاء.

كل تغيير لا يزال يمر عبر المراجعة البشرية. من بين 388 طلب سحب افتتحها كلود، تم دمج 180 منها، مما يعني أن المراجعين قبلوا نصفها تقريبًا، بينما تم رفض الباقي أو التخلي عنه. إن معدل القبول هذا هو رقم مثير للاهتمام: فهو مرتفع بما يكفي لتبرير البنية التحتية، ومنخفض بما يكفي لإظهار أن البشر ما زالوا يسيطرون بقوة على ما يتم شحنه بالفعل.

ما الذي يشير إليه التشفير الوكيل

يعد المشروع واحدًا من أوضح الأمثلة العامة لمختبر الذكاء الاصطناعي الحدودي الذي يستخدم وكيل ترميز مستقل على نطاق واسع داخل قاعدة بيانات الإنتاج الخاصة به - ليس للعمل المميز الرائع، ولكن للصيانة غير الجذابة التي تستهلك حصة كبيرة من الوقت الهندسي الحقيقي. تتحلل قواعد التعليمات البرمجية دون تنقيح مستمر، وتتسامح معظم المؤسسات مع هذا التعفن ببساطة لأنه لا أحد يرغب في إجراء هذا التنقيح. تشير أرقام الأنثروبيك إلى أن الوكيل يمكنه فعل الكثير منها بشكل مقبول.

كما أنه يأتي أيضًا في أسبوع من الأخبار المتناقضة حول عملاء Anthropic. توصلت دراسة أنثروبولوجية منفصلة تم نشرها هذا الأسبوع إلى أنه عندما تم إطلاق العديد من عملاء الذكاء الاصطناعي للقيام بنفس المهمة، بدأوا في خداع وتخريب بعضهم البعض في "حرب نفوذ" على الموارد المشتركة. تبدو الصيانة المستقلة - وكيل واحد، مجال واحد واسع النطاق، ومراجعة بشرية عند البوابة - مختلفة تمامًا عن الفوضى العدائية متعددة الوكلاء، وقد يكون التناقض مفيدًا للفرق التي تصمم مسارات عمل الوكلاء الخاصة بهم: يبدو أن النطاق الضيق بالإضافة إلى نقاط التفتيش البشرية هي المجموعة التي تعمل اليوم.

بالنسبة للصناعة الأوسع، تحدد الأرقام معيارًا يمكن للمنظمات الهندسية الأخرى قياسه. إذا تمكن وكيل الذكاء الاصطناعي من الحفاظ على قاعدة تعليمات برمجية كبيرة متعددة المنصات مرتبة بمعدل دمج يبلغ 46 بالمائة أثناء نوم المطورين، فإن اقتصاديات عدد الموظفين المعتمدين على الصيانة ستبدو مختلفة تمامًا - ويتحول السؤال التنافسي من ما إذا كانت الفرق تستخدم وكلاء التشفير إلى مقدار الروتين الذي يرغبون في تسليمه.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →