গুগল রিসার্চ বিশ্বস্ত এক্সিকিউশন এনভায়রনমেন্টের উপর নির্মিত একটি পরবর্তী প্রজন্মের ফেডারেটেড লার্নিং সিস্টেম ঘোষণা করেছে, এবং দলটি এমন একটি দাবি করছে যা কয়েক বছর আগে পৌঁছানো যায় না বলে বরখাস্ত করা হত: ফেডারেটেড শেখার জন্য বাহ্যিকভাবে যাচাইযোগ্য কেন্দ্রীয় ডিফারেনশিয়াল গোপনীয়তা গ্যারান্টি, প্রথমবারের মতো। সিস্টেম, যা জিবোর্ডে প্রয়োগ করা হচ্ছে, ক্রিপ্টোগ্রাফিক প্রত্যয়ন এবং পাবলিক লগগুলির সাথে একটি দীর্ঘস্থায়ী "আমাদের বিশ্বাস করুন" ব্যবস্থাকে প্রতিস্থাপন করে যা বাইরের নিরীক্ষকরা প্রকৃতপক্ষে পরিদর্শন করতে পারে। গোপনীয়তা-সংরক্ষণকারী মেশিন লার্নিং এর চলমান কভারেজের জন্য, আমাদের नवीनतम AI উন্নয়ন অনুসরণ করুন।
ফেডারেটেড শেখার বিশ্বাসের ফাঁক
ফেডারেটেড লার্নিং, যা Google 2017 সালে চালু করেছিল, একটি নির্দিষ্ট সমস্যার সমাধান করার কথা ছিল: কেন্দ্রীয়ভাবে ডেটা সংগ্রহ না করে কীভাবে ব্যবহারকারীর ডেটাতে দরকারী মডেলগুলিকে প্রশিক্ষণ দেওয়া যায়। একটি সার্ভারে কাঁচা টাইপিং আচরণ আপলোড করার পরিবর্তে, ডিভাইসগুলি স্থানীয়ভাবে মডেল আপডেটগুলি গণনা করে এবং শুধুমাত্র সেই আপডেটগুলিতে অবদান রাখে। এই পদ্ধতিটি ব্যবহারকারীরা প্রতিদিন যা স্পর্শ করে তার একটি উল্লেখযোগ্য পরিমাণকে শান্তভাবে ক্ষমতা দেয় — পরবর্তী শব্দের পূর্বাভাস এবং Gboard-এ স্মার্ট কম্পোজ, Google বার্তাগুলিতে উত্তরের পরামর্শ এবং Android-এ স্মার্ট টেক্সট নির্বাচন।
কিন্তু মূল স্থাপত্যের কেন্দ্রে আস্থার ফাঁক ছিল। ডিভাইসগুলি অবিলম্বে একত্রিত করার জন্য তাদের ডেটা আপলোড করেছে এবং বহিরাগতদের কাছে যাচাই করার কোন উপায় ছিল না যে ডেটা কখনই লগ করা, ধরে রাখা বা পরিদর্শন করা হয়নি৷ সার্ভার-সাইডে যা ঘটেছে তার জন্য ব্যবহারকারীদের গুগলের কথা নিতে হয়েছিল। পরে, সিকিউর অ্যাগ্রিগেশন ক্রিপ্টোগ্রাফিক সুরক্ষা যোগ করেছে যাতে ব্যক্তিগত অবদানগুলি বিচ্ছিন্নভাবে পড়া যায় না — কিন্তু সেই কৌশলটি অত্যাধুনিক সেন্ট্রাল ডিফারেনশিয়াল প্রাইভেসি অ্যালগরিদম যেমন ম্যাট্রিক্স ফ্যাক্টরাইজেশন DP-FTRL-এর সাথে সামঞ্জস্যপূর্ণ ছিল না এবং এটি এখনও একটি অনুমানকে স্পর্শ করেনি: ভিন্নতা যুক্ত করার জন্য Google কে বিশ্বাস করতে হবে না। একটি ভুল কনফিগার করা নয়েজ প্যারামিটার ভুল করা কোম্পানি ব্যতীত সকলের কাছে অদৃশ্য হবে।
নতুন সিস্টেম কিভাবে কাজ করে
নতুন নকশা সরাসরি বিশ্বাস অনুমান আক্রমণ. এটি ক্লায়েন্ট গ্রেডিয়েন্ট কম্পিউটেশনকে সার্ভারে নিয়ে যায় — একটি ট্রাস্টেড এক্সিকিউশন এনভায়রনমেন্টের ভিতরে — এবং তারপর সেই সার্ভার লজিকটিকে প্রমাণযোগ্য করে তোলে, তাই অপারেটরকে আর বিশ্বাস করার দরকার নেই। একটি TEE হল একটি হার্ডওয়্যার-বিচ্ছিন্ন প্রসেসর এনক্লেভ যার চলমান কোড বহিরাগতদের দ্বারা ক্রিপ্টোগ্রাফিকভাবে যাচাই করা যেতে পারে; যদি ছিটমহল তার দাবি ছাড়া অন্য কিছু করে, তাহলে প্রত্যয়ন ভেঙ্গে যায়।
গুগলের ঘোষণা অনুযায়ী, সিস্টেমটি চারটি মূল উপাদান সমন্বয় করে। প্রথমত, ডেটা আপলোড: ডিভাইসগুলি স্থানীয়ভাবে প্রশিক্ষণের উদাহরণগুলি এনক্রিপ্ট করে এবং একটি অ্যাক্সেস নীতিকে প্রাক-অনুমোদিত করে যা ঠিক কোন TEE গণনাগুলি ডেটা প্রক্রিয়া করতে পারে তা তালিকাভুক্ত করে — এবং সেই নীতিগুলি অবশ্যই একটি সর্বজনীন স্বচ্ছতা লগে উপস্থিত হতে হবে৷ দ্বিতীয়ত, RAFT কনসেনসাস প্রোটোকল চালিত TEE থেকে তৈরি একটি কী ম্যানেজমেন্ট সিস্টেম শুধুমাত্র প্রকাশিত নীতির সাথে মেলে এমন কাজের চাপে ডিক্রিপশন কী প্রকাশ করে। তৃতীয়, ওয়ার্কলোড এক্সিকিউশন: একটি রুট TEE একটি পাইথন ট্রেনিং লুপ চালায় এবং Google এর TensorFlow ফেডারেটেড ফ্রেমওয়ার্ক থেকে উদ্ভূত ফেডারেটেড ল্যাঙ্গুয়েজ নামক একটি সিস্টেম দ্বারা পরিচালিত অর্কেস্ট্রেশন সহ কর্মী TEE-কে সাবটাস্ক অর্পণ করে। ছিটমহল থেকে শুধুমাত্র পৃথকভাবে ব্যক্তিগত মডেলের ওজন ছাড়া হয়। চতুর্থ, ত্রুটি-সহনশীল পুনরুদ্ধার: প্রতিটি প্রশিক্ষণ রাউন্ড একটি KMS-এনক্রিপ্ট করা পুনরুদ্ধারের অবস্থা সংরক্ষণ করে যাতে রুট বা কর্মীদের ব্যর্থতা অগ্রগতি প্রশিক্ষণকে ধ্বংস না করে।
কেন গ্যারান্টি আসলে যাচাই করা যায়
যাচাইযোগ্যতা দাবি কর্পোরেট প্রত্যয়নের পরিবর্তে জনসাধারণের প্রমাণের শৃঙ্খলের উপর নির্ভর করে। অ্যাক্সেস নীতিগুলি Rekor, Sigstore-এর পাবলিক ট্রান্সপারেন্সি লগ-এ প্রকাশিত হয়, যাতে বাহ্যিক নিরীক্ষকরা প্রতিটি সার্ভারের কাজের চাপকে ট্র্যাক করতে পারে যা একটি ডিভাইসের ডেটা সম্ভবত ফিড করতে পারে। KMS এবং ডেটা-প্রসেসিং বাইনারিগুলি ওপেন-সোর্স কোড থেকে পুনরুত্পাদনযোগ্যভাবে তৈরি করা যায়, যার অর্থ যে কেউ প্রকাশিত উত্সটি কম্পাইল করতে পারে এবং নিশ্চিত করতে পারে যে এটি উত্পাদনে চলমান বাইনারিগুলির সাথে মেলে।
নীতিগুলি নিজেই পাইথন প্রশিক্ষণ প্রোগ্রামকে সরাসরি বর্ণনা করে, যা গোপনীয়তা আর্কিটেকচারের সবচেয়ে সাধারণ ছিদ্রপথ বন্ধ করে দেয়: একটি গোপনীয়তা নীতি যা বলে এবং কোডটি আসলে কী করে তার মধ্যে একটি ব্যবধান। মালিকানাধীন মডেল আর্কিটেকচারগুলিকে রক্ষা করার জন্য, টিইই রানটাইমে সাইডলোডিং সিরিয়ালাইজড লজিক সমর্থন করে — তবে একটি কঠিন সীমাবদ্ধতার সাথে যে সমস্ত গোপনীয়তা-প্রাসঙ্গিক যুক্তি অবশ্যই সত্যায়িত প্রোগ্রামে হার্ডকোডেড থাকতে হবে। Google-এর নিজস্ব পরিকাঠামো কর্মীদের সহ কাজের চাপ অপারেটররা শুধুমাত্র মেট্রিক্স এবং পৃথকভাবে ব্যক্তিগত মডেলের ওজন দেখে। এনক্রিপ্ট করা ডেটা আপলোড করার পরে শুধুমাত্র একটি সীমিত সময়ের জন্য ডিক্রিপ্ট করা যেতে পারে, উইন্ডোটি বাউন্ড করে যেখানে কিছু পরিদর্শন করা যেতে পারে।
প্রতিশ্রুতি থেকে প্রমাণ
ডিজাইনের তাৎপর্য এটি তৈরি করা বোঝার পরিবর্তনের তুলনায় কোনো একক উপাদান কম নয়। মেশিন লার্নিংয়ে গোপনীয়তার গ্যারান্টি ঐতিহাসিকভাবে নীতি নথি, অভ্যন্তরীণ নিরীক্ষা এবং অপারেটরের খ্যাতি দ্বারা সমর্থিত প্রতিশ্রুতি হিসাবে তৈরি করা হয়েছে। এই সিস্টেম সেই প্রতিশ্রুতিগুলিকে আর্টিফ্যাক্টগুলিতে রূপান্তরিত করে — প্রত্যয়ন প্রতিবেদন, স্বচ্ছতা-লগ এন্ট্রি, পুনরুত্পাদনযোগ্য বিল্ড — যা একজন সন্দেহবাদী Google এর অভ্যন্তরীণ অ্যাক্সেস ছাড়াই যাচাই করতে পারে।
এটি দুটি গবেষণা সম্প্রদায়ের একটি উল্লেখযোগ্য অভিসারকে চিহ্নিত করে যা বেশিরভাগ সমান্তরালে কাজ করেছে। বিশ্বস্ত এক্সিকিউশন এনভায়রনমেন্ট এবং ডিফারেনশিয়াল প্রাইভেসি বিভিন্ন সমস্যার সমাধান করে: টিইই সীমাবদ্ধ করে যে কে ডেটা গণনা করতে পারে, যখন ডিপি সীমাবদ্ধ করে যে কোনও গণনা কী লিক হতে পারে। যাচাইকৃত ছিটমহলের অভ্যন্তরে DP নয়েজ জেনারেশনের সাথে একটি একক প্রত্যয়নযোগ্য প্রোগ্রামের অধীনে তাদের একত্রিত করা, বিচ্ছিন্নভাবে প্রতিটি পদ্ধতির অবশিষ্ট দুর্বলতাকে সম্বোধন করে।
আপাতত সিস্টেমটি Google-এর নিজস্ব স্ট্যাকে চলছে, যে ধরনের Gboard সঞ্চালন করে তার প্রশিক্ষণের কাজের লোডগুলিকে শক্তিশালী করে৷ যাচাইযোগ্য গোপনীয়তা শিল্প জুড়ে একটি প্রতিযোগিতামূলক প্রত্যাশা হয়ে উঠবে কিনা — যেভাবে HTTPS স্বচ্ছতা লগিং করার পরে শংসাপত্রের জন্য প্রমিত হয়েছিল — ব্যবহারকারী এবং নিয়ন্ত্রকরা এই সিস্টেমটি উত্তর দেওয়ার জন্য ডিজাইন করা প্রশ্নটি অন্য AI প্রদানকারীদের জিজ্ঞাসা করা শুরু করে কিনা তা নির্ভর করবে: এটি প্রমাণ করুন৷
---
এআই থেকে এগিয়ে থাকুনসর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।
আরও এআই খবর পড়ুন →