Google रिसर्चने विश्वासार्ह अंमलबजावणी वातावरणावर तयार केलेली पुढील पिढीची फेडरेशनल लर्निंग सिस्टीमची घोषणा केली आहे आणि टीम असा दावा करत आहे जी काही वर्षांपूर्वी अगम्य म्हणून डिसमिस केली गेली असती: फेडरेशनच्या शिक्षणासाठी बाहेरून पडताळणी करण्यायोग्य केंद्रीय भिन्नता गोपनीयता हमी, प्रथमच. जीबोर्डवर लागू होत असलेली प्रणाली, क्रिप्टोग्राफिक प्रमाणीकरण आणि सार्वजनिक लॉगसह दीर्घकाळ चाललेल्या "आमच्यावर विश्वास ठेवा" व्यवस्थेची जागा घेते ज्याची बाहेरील ऑडिटर्स प्रत्यक्षात तपासणी करू शकतात. गोपनीयतेचे संरक्षण करणाऱ्या मशीन लर्निंगच्या चालू कव्हरेजसाठी, आमच्या नवीनतम AI घडामोडी फॉलो करा.
फेडरेटेड लर्निंगमधील ट्रस्ट गॅप
फेडरेटेड लर्निंग, जे Google ने 2017 मध्ये सादर केले होते, एक विशिष्ट समस्या सोडवायची होती: तो डेटा केंद्रीयरित्या गोळा केल्याशिवाय वापरकर्त्याच्या डेटावर उपयुक्त मॉडेल कसे प्रशिक्षित करावे. सर्व्हरवर रॉ टायपिंग वर्तन अपलोड करण्याऐवजी, डिव्हाइस स्थानिक पातळीवर मॉडेल अद्यतनांची गणना करतात आणि केवळ त्या अद्यतनांचे योगदान देतात. वापरकर्ते दररोज काय स्पर्श करतात या दृष्टीकोनातून शांतपणे शक्ती मिळते — पुढील शब्दाचा अंदाज आणि Gboard मध्ये स्मार्ट कंपोझ, Google Messages मधील प्रत्युत्तर सूचना आणि Android मध्ये स्मार्ट टेक्स्ट सिलेक्शन.
पण मूळ वास्तूमध्ये त्याच्या केंद्रस्थानी विश्वासाचे अंतर होते. डिव्हाइसेसनी त्यांचा डेटा तत्काळ एकत्र करण्यासाठी अपलोड केला आणि बाहेरील लोकांकडे डेटा कधीही लॉग इन, ठेवला किंवा तपासला गेला नाही हे सत्यापित करण्याचा कोणताही मार्ग नव्हता. सर्व्हर-साइड काय झाले यासाठी वापरकर्त्यांना Google चा शब्द घ्यावा लागला. नंतर, सिक्युअर एग्रीगेशनने क्रिप्टोग्राफिक संरक्षण जोडले जेणेकरून वैयक्तिक योगदान एकाकी वाचता येणार नाही — परंतु ते तंत्र मॅट्रिक्स फॅक्टरायझेशन DP-FTRL सारख्या अत्याधुनिक सेंट्रल डिफरेंशियल प्रायव्हसी अल्गोरिदमशी सुसंगत नव्हते आणि तरीही एक गृहितक अस्पर्शित राहिले: भिन्नता जोडण्यासाठी Google वर विश्वास ठेवावा लागला. चुकीचे कॉन्फिगर केलेले नॉइज पॅरामीटर चूक करणारी कंपनी वगळता प्रत्येकासाठी अदृश्य असेल.
नवीन प्रणाली कशी कार्य करते
नवीन डिझाइन थेट विश्वासाच्या गृहीतकावर हल्ला करते. ते क्लायंट ग्रेडियंट गणनेला सर्व्हरवर हलवते — विश्वासार्ह अंमलबजावणी वातावरणात — आणि नंतर ते सर्व्हर लॉजिक साक्ष्य करण्यायोग्य बनवते, त्यामुळे ऑपरेटरला यापुढे अजिबात विश्वास ठेवण्याची गरज नाही. TEE हा हार्डवेअर-पृथक प्रोसेसर एन्क्लेव्ह आहे ज्याचा चालणारा कोड क्रिप्टोग्राफिक पद्धतीने बाहेरील लोकांकडून सत्यापित केला जाऊ शकतो; एन्क्लेव्हने दावा केल्याखेरीज काहीतरी केले तर, प्रमाणीकरण खंडित होते.
Google च्या घोषणेनुसार, सिस्टम चार मुख्य घटकांचे समन्वय करते. प्रथम, डेटा अपलोड: डिव्हाइस स्थानिक पातळीवर प्रशिक्षण उदाहरणे कूटबद्ध करतात आणि प्रवेश धोरण पूर्व-अधिकृत करतात जे TEE गणना डेटावर प्रक्रिया करू शकतात - आणि ती धोरणे सार्वजनिक पारदर्शकता लॉगमध्ये दिसणे आवश्यक आहे. दुसरे, RAFT एकमत प्रोटोकॉल चालवणाऱ्या TEE मधून तयार केलेली की मॅनेजमेंट सिस्टीम केवळ प्रकाशित धोरणाशी जुळणाऱ्या वर्कलोडसाठी डिक्रिप्शन की जारी करते. तिसरे, वर्कलोड एक्झिक्यूशन: रूट TEE पायथन ट्रेनिंग लूप चालवते आणि Google च्या TensorFlow Federated फ्रेमवर्कमधून व्युत्पन्न केलेल्या Federated Language नावाच्या प्रणालीद्वारे हाताळलेल्या ऑर्केस्ट्रेशनसह कामगार TEE ला सबटास्क सोपवते. एन्क्लेव्हमधून फक्त वेगळे खाजगी मॉडेलचे वजन सोडले जाते. चौथे, दोष-सहिष्णु पुनर्प्राप्ती: प्रत्येक प्रशिक्षण फेरी KMS-एनक्रिप्टेड पुनर्प्राप्ती स्थिती वाचवते जेणेकरुन रूट किंवा कार्यकर्ता अपयश प्रगती-प्रगत प्रशिक्षण नष्ट करू शकत नाहीत.
हमीभाव प्रत्यक्षात का तपासले जाऊ शकतात
पडताळणीचा दावा कॉर्पोरेट प्रमाणीकरणाऐवजी सार्वजनिक पुराव्याच्या साखळीवर अवलंबून असतो. प्रवेश धोरणे Rekor, Sigstore च्या सार्वजनिक पारदर्शकता लॉगवर प्रकाशित केली जातात, त्यामुळे बाह्य ऑडिटर्स प्रत्येक सर्व्हर वर्कलोडचा मागोवा घेऊ शकतात जे डिव्हाइसचा डेटा शक्यतो फीड करू शकतात. KMS आणि डेटा-प्रोसेसिंग बायनरी ओपन-सोर्स कोडमधून पुनरुत्पादन करण्यायोग्य आहेत, याचा अर्थ कोणीही प्रकाशित स्त्रोत संकलित करू शकतो आणि ते उत्पादनात चालू असलेल्या बायनरीशी जुळत असल्याची पुष्टी करू शकतो.
धोरणे स्वतः पायथन प्रशिक्षण कार्यक्रमाचे थेट वर्णन करतात, जे प्रायव्हसी आर्किटेक्चरमधील सर्वात सामान्य पळवाट बंद करते: गोपनीयता धोरण काय म्हणते आणि कोड प्रत्यक्षात काय करतो यामधील अंतर. प्रोप्रायटरी मॉडेल आर्किटेक्चर्सचे संरक्षण करण्यासाठी, टीईई रनटाइमच्या वेळी साइडलोडिंग सीरियलाइज्ड लॉजिकचे समर्थन करतात — परंतु सर्व गोपनीयता-संबंधित लॉजिक प्रमाणित प्रोग्राममध्ये हार्डकोड केलेले असणे आवश्यक आहे. Google च्या स्वतःच्या इन्फ्रास्ट्रक्चर कर्मचाऱ्यांसह वर्कलोड ऑपरेटर फक्त मेट्रिक्स आणि वेगळे खाजगी मॉडेल वजन पाहतात. एन्क्रिप्ट केलेला डेटा अपलोड केल्यानंतर मर्यादित काळासाठीच डिक्रिप्ट केला जाऊ शकतो, ज्या विंडोमध्ये काहीही तपासले जाऊ शकते.
आश्वासनांपासून ते पुराव्यापर्यंत
डिझाईनचे महत्त्व कोणत्याही एका घटकामुळे निर्माण होणाऱ्या ओझ्यापेक्षा कमी आहे. मशिन लर्निंगमधील गोपनीयतेची हमी ऐतिहासिकदृष्ट्या पॉलिसी दस्तऐवज, अंतर्गत ऑडिट आणि ऑपरेटरच्या प्रतिष्ठेद्वारे समर्थित आश्वासने म्हणून तयार केली गेली आहे. ही प्रणाली त्या वचनांना कलाकृतींमध्ये रूपांतरित करते — प्रमाणीकरण अहवाल, पारदर्शकता-लॉग नोंदी, पुनरुत्पादन करण्यायोग्य बिल्ड — जे संशयवादी Google च्या अंतर्गत प्रवेशाशिवाय सत्यापित करू शकतात.
हे दोन संशोधन समुदायांचे लक्षणीय अभिसरण देखील चिन्हांकित करते ज्यांनी बहुतेक समांतरपणे काम केले आहे. विश्वसनीय अंमलबजावणी वातावरण आणि भिन्न गोपनीयता विविध समस्यांचे निराकरण करतात: टीईई डेटाची गणना कोण करू शकते हे प्रतिबंधित करते, तर डीपी कोणतीही गणना काय लीक करू शकते यावर प्रतिबंधित करते. सत्यापित एन्क्लेव्हमध्येच डीपी नॉईज जनरेशनसह, एकाच प्रमाणित कार्यक्रमांतर्गत त्यांना एकत्र करणे, प्रत्येक दृष्टीकोनाच्या अवशिष्ट कमकुवतपणाला अलगावमध्ये संबोधित करते.
सध्या ही सिस्टीम Google च्या स्वतःच्या स्टॅकमध्ये चालत आहे, Gboard प्रमाणेच प्रशिक्षण वर्कलोडला शक्ती देते. सत्यापित करण्यायोग्य गोपनीयता ही संपूर्ण उद्योगातील स्पर्धात्मक अपेक्षा बनते का — प्रमाणपत्रांसाठी पारदर्शकता लॉगिंग केल्यानंतर HTTPS ने ज्या प्रकारे केले — वापरकर्ते आणि नियामक इतर AI प्रदात्यांना प्रश्न विचारण्यास सुरुवात करतात की ही प्रणाली उत्तर देण्यासाठी डिझाइन केलेली आहे यावर अवलंबून असेल: ते सिद्ध करा.
---
एआयच्या पुढे राहानवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक AI बातम्या वाचा →