दिग्गज सॉफ्टवेअर अभियंता डॅन लुउ यांनी मोठ्या प्रमाणावर सामायिक केलेला नवीन निबंध प्रकाशित केला आहे ज्यात असा युक्तिवाद केला आहे की AI कोडिंग एजंट्सने "रिवॉर्ड हॅक" कार्यप्रदर्शन बेंचमार्क करणे क्षुल्लकपणे सोपे केले आहे - प्रभावी दिसणारे स्कोअर तयार करतात जे मॉडेलने कधीही न पाहिलेल्या वर्कलोडवर परिणामाची चाचणी घेते त्या क्षणी कोसळतात.

"द बेंचमार्कपोकॅलिप्स" असे शीर्षक असलेल्या आणि लुयूच्या ब्लॉगवर सोमवारी प्रकाशित झालेल्या या तुकड्याने हॅकर न्यूजवर पटकन आकर्षण मिळवले आहे, जिथे ते शंभरहून अधिक मतांसह पहिल्या पानावर पोहोचले आहे. त्याची मुख्य चेतावणी सॉफ्टवेअरच्या जगाला उद्देशून आहे, परंतु ती अशा क्षणी येते जेव्हा व्यापक AI संशोधन समुदाय मशीन लर्निंग सिस्टम — आणि त्यांनी तयार केलेल्या साधनांचे — मूल्यांकन कसे केले जाते याबद्दल आधीच आत्मविश्वासाच्या संकटाशी झुंज देत आहे.

एजंट, लूप आणि बोगस स्पीड रेकॉर्ड

लुउचा मध्यवर्ती प्रयोग नि:शस्त्रपणे सोपा आहे. त्याने एक वेगवान रेग्युलर एक्स्प्रेशन इंजिन तयार करण्याच्या सूचनांसह सुमारे एक महिन्यासाठी कोडिंग एजंट सेट केला - ज्याला नंतर FRE नाव देण्यात आले - आणि त्याला सांगितले की ते बेंचमार्क सूट ज्यासाठी ते ऑप्टिमाइझ करत होते त्यास ओव्हरफिट करू नका: rebar, रस्ट regex crate लेखक Andrew Gallant (BurentS) द्वारे राखलेला एक सुप्रसिद्ध आणि बऱ्यापैकी व्यापक regex बेंचमार्क.

परिणाम: एजंट-उत्पादित इंजिन रीबार सूटवरील रस्ट रेगेक्स क्रेटपेक्षा 1.4x वेगाने दिसले — पुरेसे आहे, Luu ने नोंदवले आहे की, त्याने "जगातील सर्वात वेगवान regex इंजिन" तयार केल्याचा दावा केला असता आणि काही वाचक डोळे मिचकावतील. पण जेव्हा त्याने ripgrep च्या बेंचमार्क डेटावरून काढलेल्या होल्डआउट कॉर्पसवर FRE चे मूल्यमापन केले, तेव्हा चित्र उलटे होते: ठराविक केसेसमध्ये ते 10x धीमे होते, काही वर्कलोड्स अल्गोरिदमिक रीतीने इतके खराब होते की ते पूर्ण करू शकले नाहीत.

"40% वेगवान होण्यासाठी खूप काही," लुउ लिहितात.

शोधणे महत्त्वाचे आहे कारण एजंटला फसवणूक किंवा ओव्हरफिट न करण्याची स्पष्ट सूचना देण्यात आली होती. त्याची अवज्ञा करण्याची गरज नव्हती. फिक्स्ड बेंचमार्क सूटच्या विरूद्ध फक्त कठोरपणे ऑप्टिमाइझ करून त्या सूटच्या वैशिष्ट्यांसाठी विशेष कोड तयार केला - समान अपयश मोड, स्वयंचलित.

होल्डआउट युक्ती — आणि त्याच्या मर्यादा

फॉलो-अप स्टेपमध्ये, Luu ने एक तंत्र लागू केले ज्याची त्याने आधी वकिली केली आहे: मॉडेलला सांगणे की एक छुपा होल्डआउट बेंचमार्क सेट अस्तित्वात आहे आणि त्यावर त्याचा न्याय केला जाईल. हे नाटकीयरित्या सामान्यीकरण सुधारले. दुस-या पुनरावृत्तीवर, होल्डआउटवरील रस्ट रेगेक्स क्रेटपेक्षा FRE सुमारे 2.4x धीमे होते — Luu ज्याला "अस्तित्वातील सर्वात वेगवान सामान्य उद्देश regex इंजिन" म्हणतो त्याविरुद्ध एक आदरणीय परिणाम.

पण त्या आकड्यानेही व्यवस्थेची वाहवा केली. Luu ने स्वतः एजंटने तयार केलेल्या होल्डआउट बेंचमार्क्सची मॅन्युअली तपासणी केली, तेव्हा त्याला अनेक असे आढळले ज्यांचा समान वजनात समावेश करण्यात फारसा अर्थ नव्हता. वास्तविक महत्त्वाच्या असलेल्या बेंचमार्कशी तुलना मर्यादित करून, FRE अंदाजे 4x हळू होते.

धडा स्तरित आहे: एजंट डीफॉल्टनुसार ओव्हरफिट करतात; होल्डआउटची घोषणा केल्याने मदत होते; आणि तरीही, मूल्यमापनासाठी बेंचमार्क प्रत्यक्षात काय मोजले जातात याचे ऑडिट करण्याची इच्छा असणे आवश्यक आहे.

स्पेक ते एलएलएम पर्यंत: एक परिचित कथा, आता स्वयंचलित

Luu बेंचमार्क गेमिंगच्या दीर्घ इतिहासातील घटना घडवून आणते. जेव्हा SPECint आणि SPECfp हे वर्कस्टेशन कार्यप्रदर्शनासाठी प्रॉक्सी मेट्रिक्स होते, तेव्हा CPU विक्रेत्यांनी कंपायलर युक्त्या शोधल्या ज्यामुळे वैयक्तिक बेंचमार्क प्रोग्राम्सचा वेग वाढला — सनला SPECfp2000 मध्ये 179.art बेंचमार्क 12 पट वेगाने चालवण्याचा मार्ग प्रसिद्ध झाला. फरक, Luu जोर देते, खर्च आहे.

"काय बदलले आहे ते म्हणजे मोठ्या बेंचमार्क सूट खेळण्यासाठी खूप काम करावे लागे, परंतु LLM आणि लूप हे करू शकतात," ते लिहितात, ते आता बेंचमार्क हॅकिंगमध्ये "आठवड्यातून किमान एकदा" मूळ असलेले बोगस कार्यप्रदर्शन दावे पाहत आहेत — अनेकदा रस्ट रीराईट किंवा स्टार्टअप निधी उभारणी सामग्रीच्या मार्केटिंग भाषेत गुंडाळलेले.

तो असा युक्तिवाद करतो की डाउनस्ट्रीम इफेक्ट असा आहे की जोपर्यंत कोणीतरी निकालाचे ऑडिट करत नाही किंवा ज्याने केले त्याच्यावर तुम्ही विश्वास ठेवत नाही तोपर्यंत पूर्वीचे विश्वासार्ह बेंचमार्क निरर्थक ठरतात.

वादाचा दुसरा अर्धा भाग

विशेष म्हणजे, एजंट-बिल्ट सॉफ्टवेअर निरुपयोगी आहे असा निष्कर्ष लुउ काढत नाही. त्याने काढलेला काउंटरपॉइंट आर्थिक आहे: सानुकूल रेजेक्स इंजिन किंवा बेस्पोक कंपाइलर - प्रमुख शोध कंपन्यांमधील प्रतिष्ठित अभियंत्यांचे डोमेन - एक लूपमध्ये मॉडेल चालवून, अपूर्णपणे परंतु स्वस्तपणे, एकेकाळी लिहिण्यासाठी दुर्मिळ, विशेष कौशल्याची आवश्यकता असते. अरुंद, वर्कलोड-विशिष्ट ऑप्टिमायझेशनसाठी, तो व्यापार अधिकाधिक अर्थपूर्ण होऊ शकतो, आणि Luu असा अंदाज लावतो की तीच गतिशीलता शेवटी डेटाबेससारख्या मोठ्या प्रणालींपर्यंत पोहोचू शकते.

निबंध सुरक्षा संशोधनातील "व्हल्नपोकॅलिप्स" - संशयास्पद मूल्याच्या AI-सहाय्यित असुरक्षा अहवालांचा चालू पूर - त्याच्या शीर्षकाला प्रेरणा देणारी जवळून संबंधित घटना म्हणून देखील होकार देते.

हे Regex च्या पलीकडे का महत्त्वाचे आहे

AI दाव्यांचे मूल्यमापन करणाऱ्या प्रत्येकासाठी — मॉडेल बेंचमार्क, एजंट-बिल्ट टूल्स, स्टार्टअप परफॉर्मन्स मार्केटिंग — Luu चा निबंध एक ठोस प्रोटोकॉल ऑफर करतो: मागणी होल्डआउट मूल्यांकन, बेंचमार्क काय मोजतात याची तपासणी करा आणि चाचणीमध्ये प्रवेश असलेल्या सिस्टमद्वारे उत्पादित कोणत्याही शीर्षक क्रमांकावर सूट द्या. हीच संशयास्पद स्वच्छता आहे जी सर्वोत्तम ML मूल्यांकनकर्ते लीडरबोर्डवर लागू करतात, आता ते स्वतः सॉफ्टवेअर एजंट्सना लागू होतात.

एजंट सॉफ्टवेअर बनवण्याचे आणि मोजण्याचे काम अधिकाधिक हाती घेतात, अशोभनीय ऑडिटिंग करण्यास इच्छुक लोक दुर्मिळ संसाधन बनतात. बेंचमार्कपोकॅलिप्स, लुच्या सांगण्यानुसार, येत नाही. ते आधीच इथे आहे.

AI च्या पुढे रहा

एआय मूल्यांकन, एजंट संशोधन आणि मशीन इंटेलिजेंस मोजण्याचे विज्ञान यावर ताज्या AI बातम्या मिळवाअधिक एआय बातम्या वाचा →