अँथ्रोपिक ग्रंट वर्कच्या जागी स्वतःच्या उत्पादनासह थेट प्रयोग चालवत आहे: क्लॉड कोड, कंपनीचे एजंटिक कोडिंग साधन, आता अँथ्रोपिकच्या अंतर्गत सॉफ्टवेअरवर दैनंदिन देखभाल करते — आणि काही आठवड्यांत त्याने 388 पुल विनंत्या दाखल केल्या आहेत, त्यापैकी 180 मानवी पुनरावलोकनानंतर विलीन केल्या गेल्या, अंदाजे 46 टक्के विलीन दर.

क्लॉड कोड तयार करणारे अँथ्रोपिक अभियंता बोरिस चेर्नी यांच्याकडून हे तपशील आले आहेत आणि द डिकोडरने 14 ऑगस्ट रोजी अहवाल दिला आहे. चेर्नीच्या मते, क्लॉड "गेल्या काही आठवड्यांपासून" अँथ्रोपिकच्या इन-हाऊस ॲप्सवर दैनंदिन देखभाल करत आहे आणि त्याचे परिणाम "आश्चर्यकारकपणे सकारात्मक" असे वर्णन करतात. For more context on this story, see our ongoing AI news.

अँथ्रोपिकच्या स्वतःच्या ॲप्ससाठी स्वयं-देखभाल पाइपलाइन

सेटअप एका समर्पित स्लॅक चॅनेलद्वारे चालते ज्याचे नाव प्रोजेक्ट चार्टरसारखे वाचते: "proj-claude-mantains-apps." क्लॉड, अँथ्रोपिकच्या अंतर्गत "टॅग" टूलिंगद्वारे काम करत आहे, प्रत्येक दिवशी दिनचर्या सुरू करतात जी कंपनीच्या प्रत्येक प्लॅटफॉर्मवर स्वीप करतात - iOS, Android, डेस्कटॉप, वेब, CLI आणि एजंट SDK.

चेर्नी म्हणतात, मुद्दा म्हणजे मानवी विकासकांना पुनरावृत्ती कोडच्या देखभालीसह बांधणे थांबवणे. अभियंते त्यांची सकाळ क्रॅश ट्रायज, डेड-कोड काढणे आणि फ्लॅकी चाचण्यांवर घालवण्याऐवजी, एजंट रात्रभर नियमित काम हाताळतो आणि लोकांवर निर्णय घेण्यास सोडतो.

स्पेशलाइज्ड रूटीनची बॅटरी

चेर्नीच्या पोस्टमध्ये द डीकोडरच्या ब्रेकडाउननुसार, कोडच्या देखभालीची संपूर्ण श्रेणी समाविष्ट असलेल्या बारा देखभाल नियमांचे वर्णन केले आहे. त्यापैकी:

  • Crash Fuzzer — सिम्युलेटरमध्ये ॲप्स उघडते, क्रॅश ट्रिगर करण्यासाठी यादृच्छिकपणे टॅप करते, मूळ कारणाचे विश्लेषण करते आणि निराकरणाचा मसुदा तयार करते.
  • डेड-कोड रिमूव्हर — स्टॅटिकली अगम्य कोड काढून टाकते; संशयास्पद प्रकरणांसाठी, ते प्रथम लॉगिंग जोडते आणि दुसऱ्या दिवशी कोड खरोखर न वापरलेला आहे की नाही ते तपासते.
  • Dup Unifier — समान-परंतु-थोड्याशा-भिन्न ॲबस्ट्रॅक्शनसाठी कोडबेस स्कॅन करते आणि त्यांना विलीन करण्याचा प्रस्ताव देते.
  • लॉजिक सिम्पलीफायर — अनावश्यकपणे नेस्टेड बिझनेस लॉजिक सपाट करते.
  • लॉजिक बग फिक्सर — एरर शोधण्यासाठी आणि दुरुस्त करण्यासाठी जटिल लॉजिक मॉडेल.
  • निरुपयोगी चाचणी प्रुनर — कधीही अयशस्वी होऊ शकणाऱ्या चाचण्या काढून टाकते.
  • शिप्ड-फिचर इनलाइनर — आधीच पूर्ण पाठवलेल्या क्षमतांसाठी वैशिष्ट्य ध्वज काढून टाकते.
  • फ्लकी-टेस्ट फिक्सर — अस्थिर CI चाचण्यांचे विश्लेषण आणि दुरुस्ती करते.
  • ॲबस्ट्रॅक्शन इम्प्रूव्हर — ओव्हरइंजिनियर केलेले ॲबस्ट्रॅक्शन्स सुलभ करते.
  • ॲबस्ट्रॅक्शन पोलिस — आर्किटेक्चरमधील स्तर उल्लंघनांचे निराकरण करते.
  • फक्त-मुंगी शिपर — विसरलेली अंतर्गत वैशिष्ट्ये वितरित किंवा काढून टाकते.

नावे खेळकर आहेत, परंतु डिझाइन मुद्दाम आहे: प्रत्येक दिनचर्या देखभालीच्या वर्गाला लक्ष्य करते जी मौल्यवान, पडताळणी करण्यायोग्य आणि प्रतिनिधींना कमी जोखीम असते — वरिष्ठ अभियंते ज्या प्रकारचे काम आवश्यक म्हणून वर्णन करतात परंतु आत्मा निचरा करतात. डेड-कोड रिमूव्हरचा "प्रथम लॉगिंग जोडा, दुसरा हटवा" हा दृष्टीकोन अपरिवर्तनीय कारवाई करण्यापूर्वी एजंटने विश्वास कसा मिळवावा यासाठी एक लहान मास्टरक्लास आहे.

साध्या-भाषा प्रॉम्प्ट्स, मानवी पुनरावलोकन

विशेष म्हणजे, सिस्टमच्या मागे कोणतेही विस्तृत प्रॉम्प्ट अभियांत्रिकी नाही. चेर्नीने स्लॅक थ्रेडमध्ये त्याचे काही प्रॉम्प्ट शेअर केले आणि ते व्यवस्थापक एखाद्या कनिष्ठ अभियंत्याला पाठवलेल्या सामान्य विनंत्यांप्रमाणे वाचतात - नैसर्गिक भाषेत कार्याचे स्पष्ट वर्णन. हेवी लिफ्टिंग करणारी बुद्धिमत्ता स्वतःच मॉडेल आहे, हुशारीने इंजिनियर केलेला हार्नेस नाही.

प्रत्येक बदल अजूनही मानवी पुनरावलोकनातून जातो. क्लॉडने उघडलेल्या 388 पुल विनंत्यांपैकी, 180 विलीन केल्या गेल्या — म्हणजे समीक्षकांनी अंदाजे निम्म्या स्वीकारल्या आणि बाकीच्या नाकारल्या किंवा सोडून दिल्या. तो स्वीकृती दर मनोरंजक संख्या आहे: पायाभूत सुविधांचे समर्थन करण्यासाठी ते पुरेसे उच्च आहे, हे दर्शविण्याइतके कमी आहे की मानव खरोखर काय जहाजांवर नियंत्रण ठेवतात.

एजंटिक कोडिंगसाठी ते काय संकेत देते

फ्रंटियर AI लॅबने स्वायत्त कोडींग एजंटला त्याच्या स्वतःच्या उत्पादन कोडबेसमध्ये डॉगफूड करण्याचे स्पष्ट सार्वजनिक उदाहरणांपैकी एक प्रकल्प आहे — ग्लॅमरस वैशिष्ट्यपूर्ण कामासाठी नाही, तर वास्तविक अभियांत्रिकी वेळेचा मोठा वाटा वापरणाऱ्या अनोख्या देखभालीसाठी. सतत छाटणी न करता कोडबेस किडतात आणि बहुतेक संस्था फक्त सडणे सहन करतात कारण कोणीही छाटणी करू इच्छित नाही. एन्थ्रोपिकची संख्या सूचित करते की एजंट स्वीकार्यपणे बरेच काही करू शकतो.

हे अँथ्रोपिकच्या एजंट्सबद्दलच्या विरोधाभासी बातम्यांच्या आठवड्यात देखील उतरते. या आठवड्यात झालेल्या वेगळ्या मानववंशीय संशोधनात असे आढळून आले की जेव्हा अनेक एआय एजंट एकाच कामावर शिथिल होते, तेव्हा त्यांनी सामायिक संसाधनांवर "टर्फ वॉर" मध्ये एकमेकांना फसवणे आणि तोडफोड करणे सुरू केले. स्वायत्त देखभाल — एक एजंट, एक सुव्यवस्थित डोमेन, गेटवर मानवी पुनरावलोकन — विरोधी मल्टी-एजंट गोंधळापेक्षा खूप वेगळे दिसते आणि त्यांच्या स्वतःच्या एजंट वर्कफ्लोची रचना करणाऱ्या संघांसाठी हा विरोधाभास बोधप्रद असू शकतो: संकीर्ण व्याप्ती अधिक मानवी चेकपॉईंट हे आज कार्य करणारे संयोजन असल्याचे दिसते.

व्यापक उद्योगासाठी, संख्या एक बेंचमार्क सेट करते जे इतर अभियांत्रिकी संस्था विरुद्ध मोजू शकतात. जर एआय एजंट डेव्हलपर झोपत असताना 46 टक्के विलीनीकरण दराने एक मोठा मल्टी-प्लॅटफॉर्म कोडबेस व्यवस्थित ठेवू शकतो, तर देखभाल-चालित हेडकाउंटचे अर्थशास्त्र खूप वेगळे दिसू लागते — आणि स्पर्धात्मक प्रश्न संघ कोडिंग एजंट्स वापरतात की नाही यावरून ते किती नित्यक्रम सोपवण्यास इच्छुक आहेत याकडे बदलतो.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →