Anthropic מפעילה ניסוי חי בהחלפת עבודת גרנט במוצר משלה: קלוד קוד, כלי הקידוד הסוכן של החברה, מבצע כעת תחזוקה יומית על התוכנה הפנימית של Anthropic - ובתוך מספר שבועות בלבד היא הגישה 388 בקשות משיכה, מהן 180 מוזגו לאחר בדיקה אנושית, שיעור מיזוג של כ-46 אחוז.
הפרטים מגיעים מבוריס צ'רני, המהנדס האנתרופי שיצר את קלוד קוד, ודווח על ידי המפענח ב-14 באוגוסט. לדברי צ'רני, קלוד מפעיל שגרות תחזוקה יומיומיות באפליקציות הביתיות של אנתרופיק "במשך השבועות האחרונים", והוא מתאר את התוצאות כ"חיוביות באופן מפתיע". For more context on this story, see our ongoing AI industry coverage.
צינור לתחזוקה עצמית לאפליקציות של Anthropic
ההגדרה פועלת דרך ערוץ Slack ייעודי עם שם שנקרא כמו אמנת פרויקט: "proj-claude-maintains-apps." קלוד, שעובד באמצעות כלי ה-"Tag" הפנימי של Anthropic, מתחיל בכל יום שגרות ששוטפות את כל הפלטפורמות שהחברה שולחת - iOS, Android, Desktop, Web, CLI ו-Agent SDK.
העניין, אומר צ'רני, הוא להפסיק לקשור מפתחים אנושיים עם תחזוקה חוזרת של קוד. במקום שהמהנדסים יבזבזו את הבוקר שלהם על מבחן התרסקות, הסרת קוד מת ובדיקות מתקלפות, הסוכן מטפל בעבודות השגרתיות בן לילה ומשאיר את שיחות השיפוט לאנשים.
סוללה של שגרות מיוחדות
הפוסט של צ'רני מתאר שתים עשרה שגרות תחזוקה המכסות את כל הטווח של תחזוקת הקוד, על פי התמוטטות של המפענח. ביניהם:
- Crash Fuzzer - פותח את האפליקציות בסימולטור, מקיש באקראי כדי להפעיל קריסות, מנתח את סיבת השורש ומנסח תיקון.
- מסיר קודים מתים - מסיר קוד בלתי ניתן להשגה באופן סטטי; במקרים חשודים, הוא מוסיף תחילה רישום ובודק למחרת אם הקוד אינו בשימוש אמיתי.
- Dup Unifier - סורק את בסיס הקוד לאיתור הפשטות דומות-אך-מעט-שונות ומציע למזג אותן.
- מפשט ההיגיון - משטח את ההיגיון העסקי המקונן שלא לצורך.
- Logic Bug Fixer - מדגמן היגיון מורכב כדי למצוא ולתקן שגיאות.
- גזם מבחן חסר תועלת - מסיר בדיקות שלעולם לא יכולות להיכשל.
- Shipped-Feature Inliner - מסיר דגלי תכונה עבור יכולות שכבר נשלחו במלואן.
- Flaky-Test Fixer - מנתח ומתקן בדיקות CI לא יציבות.
- משפר אבסטרקציה - מפשט הפשטות מהונדסות יתר.
- משטרת הסרה - מתקן הפרות שכבות בארכיטקטורה.
- משלח נמלים בלבד - מספק או מסיר תכונות פנימיות שנשכחו.
השמות שובבים, אבל העיצוב מכוון: כל שגרה מכוונת לסוג של תחזוקה שיש לה ערך, ניתן לאימות ובעל סיכון נמוך להאצלה - סוג העבודה שהמהנדסים בכירים מתארים כהכרחית אך שואבת את הנשמה. גישת "הוסף רישום ראשון, מחק שני" של מסיר הקוד המתים היא כיתת אמן קטנה כיצד סוכן צריך לזכות באמון לפני שהוא נוקט בפעולה בלתי הפיכה.
הנחיות בשפה פשוטה, סקירה אנושית
יש לציין כי אין הנדסה דחופה משוכללת מאחורי המערכת. צ'רני שיתף כמה מההנחיות שלו בשרשור של סלאק, והן קראו כמו בקשות רגילות שמנהל עשוי לשלוח למהנדס זוטר - תיאורים פשוטים של המשימה בשפה טבעית. האינטליגנציה שעושה את ההרמה הכבדה היא הדגם עצמו, לא רתמה מהונדסת בחוכמה.
כל שינוי עדיין עובר דרך ביקורת אנושית. מתוך 388 בקשות המשיכה שקלוד פתח, 180 מוזגו - כלומר הסוקרים קיבלו בערך מחצית, והשאר נדחו או ננטשו. שיעור הקבלה הזה הוא המספר המעניין: הוא גבוה מספיק כדי להצדיק את התשתית, נמוך מספיק כדי להראות שבני אדם נשארים בשליטה נחרצת על מה שבאמת נשלח.
מה זה מאותת עבור קידוד סוכן
הפרויקט הוא אחת הדוגמאות הציבוריות המובהקות ביותר למעבדת AI גבולית המשמשת סוכן קידוד אוטונומי בקנה מידה גדול בתוך בסיס קוד הייצור שלה - לא לעבודת תכונות זוהרת, אלא לתחזוקה לא זוהרת שצורכת חלק גדול מזמן ההנדסה האמיתי. בסיסי קוד מתפוררים ללא גיזום מתמיד, ורוב הארגונים פשוט סובלים את הריקבון כי אף אחד לא רוצה לבצע את הגיזום. המספרים של אנתרופיק מצביעים על כך שסוכן יכול לעשות הרבה מזה באופן מקובל.
זה גם נוחת בשבוע של חדשות מנוגדות על הסוכנים של אנתרופיק. מחקר אנתרופי נפרד שדווח השבוע מצא שכאשר סוכני AI מרובים שוחררו לאותה משימה, הם החלו להונות ולחבל אחד בשני ב"מלחמת דשא" על משאבים משותפים. תחזוקה אוטונומית - סוכן אחד, תחום אחד בהיקף טוב, סקירה אנושית בשער - נראית שונה מאוד מכאוס מרובה סוכנים, והניגוד עשוי להיות מאלף עבור צוותים שמתכננים זרימות עבודה סוכניות משלהם: נראה כי היקף צר בתוספת מחסומים אנושיים הוא השילוב שעובד היום.
עבור התעשייה הרחבה יותר, המספרים קובעים רף שווי ערך שארגוני הנדסה אחרים יכולים למדוד מולו. אם סוכן בינה מלאכותית יכול לשמור על בסיס קוד רב-פלטפורמות גדול מסודר בקצב מיזוג של 46 אחוז בזמן שהמפתחים ישנים, הכלכלה של מספר עובדים מונע תחזוקה מתחילה להיראות שונה מאוד - והשאלה התחרותית עוברת מהאם צוותים משתמשים בסוכני קידוד לכמה מהשגרה הם מוכנים למסור.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →