Google DeepMind ने 27 अगस्त को घोषणा की कि वह मालिकाना, फ्रंटियर-क्लास AI मॉडल का दुनिया का पहला डबल-ब्लाइंड मूल्यांकन कहता है - एक क्रिप्टोग्राफ़िक सेटअप जिसे बाहरी विशेषज्ञों को Google के मॉडल का तनाव-परीक्षण करने के लिए डिज़ाइन किया गया है, बिना दोनों पक्षों के रहस्यों को देखे।
विलियम इसाक, सोल मेसिंग और क्रिस्टियन लुम द्वारा डीपमाइंड ब्लॉग पोस्ट में वर्णित पायलट, क्रिप्टोग्राफिक रूप से सुरक्षित वातावरण के अंदर गोपनीय बेंचमार्क के माध्यम से जेमिनी फ्लैश लाइट मॉडल चलाता है। Google डीपमाइंड इस प्रयास में सिंगापुर एआई सेफ्टी इंस्टीट्यूट, ओपनमाइन्ड, एवीईआरआई और एमएलकॉमन्स के साथ साझेदारी कर रहा है और उसने कार्यप्रणाली का वर्णन करते हुए एक तकनीकी रिपोर्ट प्रकाशित की है।
घोषणा एआई मूल्यांकन में सबसे लगातार कमजोरियों में से एक को संबोधित करती है: बेंचमार्क संदूषण। [एआई शोध समाचार] (https://aibuzzwire.news) पर नज़र रखने वाले पाठकों के लिए, यह तीसरे पक्ष के मॉडल परीक्षण को सत्यापित रूप से स्वच्छ बनाने के अधिक ठोस प्रयासों में से एक का प्रतिनिधित्व करता है।
संदूषण समस्या, समझाया गया
डीपमाइंड ने कक्षा सादृश्य के साथ अपनी घोषणा शुरू की। यदि कोई छात्र गलती से परीक्षा के प्रश्न पहले ही देख लेता है, तो पूर्ण अंक का कोई मतलब नहीं है। यही तर्क फ्रंटियर मॉडल पर लागू होता है: यदि कोई मॉडल पहले से ही बेंचमार्क में प्रश्नों के संपर्क में आ चुका है - प्रशिक्षण डेटा, लीक हुए मूल्यांकन सेट या पूर्व अनुकूलन के माध्यम से - परिणामी स्कोर वास्तविक क्षमता को बड़े पैमाने पर बढ़ा सकते हैं।
यह कोई काल्पनिक चिंता नहीं है. बेंचमार्क संदूषण ने वर्षों से इस क्षेत्र को प्रभावित किया है, शोधकर्ताओं ने बार-बार दिखाया है कि लोकप्रिय परीक्षण सेट वेब-स्केल प्रशिक्षण निगम में लीक हो जाते हैं, और मॉडलों को ज्ञात मूल्यांकनों पर अच्छा प्रदर्शन करने के लिए चुपचाप तैयार किया जा सकता है। जब सरकारें और उद्यम खरीद और नीतिगत निर्णय लेने के लिए बेंचमार्क स्कोर का उपयोग करते हैं, तो बढ़ी हुई संख्या के वास्तविक परिणाम होते हैं।
डीपमाइंड का तर्क है कि जैसे-जैसे मॉडल अधिक सक्षम होते जा रहे हैं, संवेदनशील मूल्यांकन श्रेणियों - साइबर सुरक्षा परीक्षण और सरकारी मूल्यांकन उनमें से प्रमुख हैं - जहां एक दूषित स्कोर न केवल भ्रामक है बल्कि संभावित रूप से खतरनाक है।
पुराना व्यापार: आपका संकेत या हमारा वजन
ऐतिहासिक रूप से, उच्च जोखिम वाले बाहरी मूल्यांकन ने एक असुविधाजनक विकल्प को मजबूर किया। या तो मूल्यांकनकर्ता ने अपने परीक्षण संकेत मॉडल प्रदाता को सौंप दिए - यह जोखिम उठाते हुए कि प्रदाता परीक्षण प्रश्नों को पहले ही देख लेगा - या प्रदाता ने मूल्यांकनकर्ता को मॉडल भार सौंप दिया - अपनी सबसे मूल्यवान बौद्धिक संपदा के नुकसान का जोखिम उठाते हुए।
डीपमाइंड लिखता है कि जीरो-लॉगिंग प्रोटोकॉल और कठोर संविदात्मक सुरक्षा उपायों ने बाहरी परीक्षण संकेतों को लंबे समय तक गोपनीय रखा है, लेकिन वे गणित के बजाय नीति द्वारा लागू किए गए वादे हैं। डबल-ब्लाइंड मूल्यांकन उस भरोसे को क्रिप्टोग्राफ़िक प्रमाण से बदल देता है।
क्रिप्टोग्राफ़िक बॉक्स कैसे काम करता है
पायलट कॉन्फिडेंशियल स्पेस का उपयोग करता है, जो Google क्लाउड के कॉन्फिडेंशियल कंप्यूटिंग पोर्टफोलियो का हिस्सा है, जिसे डीपमाइंड एक क्रिप्टोग्राफ़िक "बॉक्स" के रूप में वर्णित करता है। इसके अंदर, मूल्यांकन के दोनों हिस्से - गोपनीय बेंचमार्क और मालिकाना मॉडल - अपने संबंधित स्वामियों के लिए निजी रहते हैं, और पर्यावरण क्रिप्टोग्राफ़िक रूप से उस तथ्य को सत्यापित करता है।
परिणाम वास्तव में डबल-ब्लाइंड है: बाहरी मूल्यांकनकर्ता जेमिनी मॉडल के वजन को नहीं देख सकता है, और Google मूल्यांकनकर्ता के परीक्षण संकेतों को नहीं देख सकता है। किसी भी पक्ष को दूसरे के वादों पर भरोसा नहीं करना चाहिए, क्योंकि वास्तुकला ही सैद्धांतिक रूप से रिसाव को असंभव बना देती है। गंभीर रूप से, सेटअप मूल्यांकन डेटा को बाद में भविष्य के परीक्षण से पहले मॉडल के प्रदर्शन को अनुकूलित करने के लिए उपयोग करने से रोकता है - उस लूप को बंद कर देता है जिसके माध्यम से संदूषण आम तौर पर वापस आ जाता है।
एआई निरीक्षण के लिए यह क्यों मायने रखता है
व्यापक महत्व एक जेमिनी मॉडल से भी आगे जाता है। स्वतंत्र संगठन - एआई सुरक्षा संस्थान, शैक्षणिक प्रयोगशालाएं, नियामक - बंद सीमा मॉडल का कड़ाई से मूल्यांकन करने के लिए वर्षों से संघर्ष कर रहे हैं, ठीक इसलिए क्योंकि प्रदाता वजन नहीं सौंप सकते हैं और मूल्यांकनकर्ता बेंचमार्क नहीं सौंपेंगे। सीमांत प्रयोगशालाओं के साथ मूल्यांकन समझौतों पर हस्ताक्षर करते समय प्रत्येक प्रमुख एआई सुरक्षा संस्थान को इस समस्या के संस्करणों से जूझना पड़ा है।
यदि पायलट कायम रहता है, तो यह एक टेम्पलेट प्रदान करता है जिसके तहत डेटा संप्रभुता और बौद्धिक संपदा स्वतंत्र जांच के संपर्क में बनी रहती है। डीपमाइंड का कहना है कि उसे उम्मीद है कि पायलट "मॉडल निरीक्षण के लिए एक नई सीमा स्थापित करेगा, जिससे व्यापक उद्योग को सुरक्षित, अधिक विश्वसनीय और व्यापक रूप से विश्वसनीय एआई सिस्टम बनाने में मदद मिलेगी।"
साझेदारों की सूची अपने आप में उल्लेखनीय है। सिंगापुर एआई सुरक्षा संस्थान सबसे सक्रिय राष्ट्रीय मूल्यांकन निकायों में से एक है; OpenMined गोपनीयता-संरक्षण संगणना टूलींग बनाता है; एमएलकॉमन्स उद्योग बेंचमार्किंग का मानकीकरण करता है। AVERI ने सरकार, शिक्षा जगत और उद्योग मानक निकायों को शामिल करते हुए एक संघ का गठन किया है - ऐसे घटक जिन्हें एक प्रदर्शन के बजाय एक आदर्श बनने के लिए डबल-ब्लाइंड मूल्यांकन अपनाने की आवश्यकता होगी।
मूल्यांकन की सत्यनिष्ठा को लेकर हथियारों की होड़
एआई कंपनियां खुद को कैसे ग्रेड करती हैं, इसकी बढ़ती जांच के बीच यह घोषणा की गई है। प्रयोगशालाओं पर अनुकूल बेंचमार्क चुनने के बढ़ते आरोपों का सामना करना पड़ रहा है, और स्वतंत्र लीडरबोर्ड प्रभावशाली हो गए हैं क्योंकि वे विक्रेताओं के नियंत्रण से बाहर हैं। डबल-ब्लाइंड मूल्यांकन विक्रेता के स्वयं के बुनियादी ढांचे के भीतर स्वतंत्रता आंदोलन का विस्तार करता है - उन कंपनियों के लिए एक उल्लेखनीय बदलाव जिन्होंने ऐतिहासिक रूप से अपने मॉडलों का परीक्षण करने के तरीके के हर विवरण को नियंत्रित करने पर जोर दिया है।
अभी के लिए, पायलट में एक मॉडल और गोपनीय बेंचमार्क का एक सेट शामिल है। लेकिन अगर क्रिप्टोग्राफ़िक रूप से सत्यापित, संदूषण-मुक्त मूल्यांकन तकनीकी रूप से नियमित हो जाता है, तो यह बदल सकता है कि उद्यम और नियामक हर सीमांत प्रयोगशाला से क्या अपेक्षा करते हैं - और सत्यापन योग्य दावों पर तेजी से बढ़ते बाजार में "हमारे स्कोर पर भरोसा करें" को बेचना कठिन बना देगा।
---
एआई से आगे रहेंनवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।
अधिक AI समाचार पढ़ें →