Google DeepMind 27শে আগস্ট ঘোষণা করেছে যে এটি একটি মালিকানাধীন, সীমান্ত-শ্রেণির AI মডেলের বিশ্বের প্রথম ডাবল-ব্লাইন্ড মূল্যায়ন বলে — একটি ক্রিপ্টোগ্রাফিক সেটআপ যা বাইরের বিশেষজ্ঞদের স্ট্রেস-পরীক্ষা করার জন্য ডিজাইন করা হয়েছে যাতে কোনও পক্ষই অন্যের গোপনীয়তা না দেখে Google-এর মডেলগুলিকে চাপ দেয়৷
পাইলট, উইলিয়াম আইজ্যাক, সল মেসিং এবং ক্রিস্টিয়ান লুমের একটি ডিপমাইন্ড ব্লগ পোস্টে বর্ণিত, একটি ক্রিপ্টোগ্রাফিকভাবে সুরক্ষিত পরিবেশের মধ্যে গোপনীয় বেঞ্চমার্কের মাধ্যমে একটি জেমিনি ফ্ল্যাশ লাইট মডেল চালান৷ Google DeepMind এই প্রচেষ্টায় সিঙ্গাপুর AI সেফটি ইনস্টিটিউট, OpenMined, AVERI এবং MLCcommons-এর সাথে অংশীদারিত্ব করছে এবং পদ্ধতিটি বর্ণনা করে একটি প্রযুক্তিগত প্রতিবেদন প্রকাশ করেছে৷
ঘোষণাটি এআই মূল্যায়নের সবচেয়ে ক্রমাগত দুর্বলতাগুলির একটিকে সম্বোধন করে: বেঞ্চমার্ক দূষণ। AI রিসার্চ নিউজ ট্র্যাক করা পাঠকদের জন্য, এটি তৃতীয় পক্ষের মডেল পরীক্ষাকে যাচাইযোগ্যভাবে পরিষ্কার করার জন্য আরও একটি দৃঢ় প্রয়াসের প্রতিনিধিত্ব করে।
দূষণ সমস্যা, ব্যাখ্যা করা হয়েছে
ডিপমাইন্ড ক্লাসরুমের উপমা দিয়ে তার ঘোষণাটি খোলে। যদি কোনো শিক্ষার্থী ভুলবশত পরীক্ষার প্রশ্নগুলো আগে থেকেই দেখেন, তাহলে নিখুঁত স্কোরের কোনো মানে হয় না। একই যুক্তি ফ্রন্টিয়ার মডেলগুলির ক্ষেত্রে প্রযোজ্য: যদি একটি মডেল ইতিমধ্যেই একটি বেঞ্চমার্কের প্রশ্নের মুখোমুখি হয়ে থাকে — প্রশিক্ষণের ডেটা, ফাঁস হওয়া ইভাল সেট বা পূর্বের অপ্টিমাইজেশনের মাধ্যমে — ফলে প্রাপ্ত স্কোরগুলি প্রকৃত ক্ষমতাকে ব্যাপকভাবে বাড়াতে পারে।
এটি একটি অনুমানমূলক উদ্বেগ নয়। বেঞ্চমার্ক দূষণ বছরের পর বছর ধরে ক্ষেত্রটিকে কুক্ষিগত করে রেখেছে, গবেষকরা বারবার দেখিয়েছেন যে জনপ্রিয় পরীক্ষার সেটগুলি ওয়েব-স্কেল প্রশিক্ষণ সংস্থায় ফাঁস হয়ে যায়, এবং সেই মডেলগুলিকে শান্তভাবে পরিচিত মূল্যায়নে ভাল করার জন্য টিউন করা যেতে পারে। যখন সরকার এবং উদ্যোগগুলি ক্রয় এবং নীতিগত সিদ্ধান্ত নেওয়ার জন্য বেঞ্চমার্ক স্কোর ব্যবহার করে, তখন স্ফীত সংখ্যাগুলি বাস্তব ফলাফল বহন করে।
মডেলগুলি আরও সক্ষম হওয়ার সাথে সাথে ডিপমাইন্ড যুক্তি দেয়, সংবেদনশীল মূল্যায়ন বিভাগগুলির জন্য বাজি সবচেয়ে বেশি - সাইবারসিকিউরিটি টেস্টিং এবং সরকারী মূল্যায়ন প্রধান - যেখানে একটি দূষিত স্কোর কেবল বিভ্রান্তিকর নয় তবে সম্ভাব্য বিপজ্জনক।
পুরাতন ট্রেডঅফ: আপনার প্রম্পট বা আমাদের ওজন
ঐতিহাসিকভাবে, উচ্চ-স্টেকের বাহ্যিক মূল্যায়ন একটি অস্বস্তিকর পছন্দ বাধ্য করে। হয় মূল্যায়নকারী তার পরীক্ষার প্রম্পটগুলি মডেল প্রদানকারীর কাছে হস্তান্তর করে — ঝুঁকি নিয়ে যে প্রদানকারী পরীক্ষার প্রশ্নগুলি আগে থেকেই দেখতে পাবে — অথবা প্রদানকারী মূল্যায়নকারীর কাছে মডেলের ওজন হস্তান্তর করে — তার সবচেয়ে মূল্যবান বৌদ্ধিক সম্পত্তি হারানোর ঝুঁকি নিয়ে।
ডিপমাইন্ড লিখেছেন, জিরো-লগিং প্রোটোকল এবং কঠোর চুক্তিগত সুরক্ষাগুলি দীর্ঘকাল বাহ্যিক পরীক্ষার প্রম্পটগুলিকে গোপনীয় রেখেছে, তবে সেগুলি গণিতের পরিবর্তে নীতি দ্বারা প্রয়োগ করা প্রতিশ্রুতি। দ্বৈত-অন্ধ মূল্যায়ন সেই বিশ্বাসকে ক্রিপ্টোগ্রাফিক প্রমাণ দিয়ে প্রতিস্থাপন করে।
কিভাবে ক্রিপ্টোগ্রাফিক বক্স কাজ করে
পাইলট গোপনীয় স্থান ব্যবহার করে, Google ক্লাউডের গোপনীয় কম্পিউটিং পোর্টফোলিওর অংশ, যা ডিপমাইন্ড একটি ক্রিপ্টোগ্রাফিক "বক্স" হিসাবে বর্ণনা করে তা তৈরি করতে। এর ভিতরে, মূল্যায়নের উভয় অর্ধেক - গোপনীয় বেঞ্চমার্ক এবং মালিকানা মডেল - তাদের নিজ নিজ মালিকদের কাছে ব্যক্তিগত থাকে এবং পরিবেশ ক্রিপ্টোগ্রাফিকভাবে সেই সত্যটি যাচাই করে।
ফলাফলটি প্রকৃতপক্ষে দ্বি-অন্ধ: বাহ্যিক মূল্যায়নকারী মিথুন মডেলের ওজন দেখতে পারে না এবং Google মূল্যায়নকারীর পরীক্ষার প্রম্পট দেখতে পারে না। কোন পক্ষকে অন্যের প্রতিশ্রুতিতে বিশ্বাস করতে হবে না, কারণ স্থাপত্য নিজেই নীতিগতভাবে ফুটো করা অসম্ভব করে তোলে। সমালোচনামূলকভাবে, সেটআপটি ভবিষ্যতের পরীক্ষার আগে মডেলের কার্যকারিতা অপ্টিমাইজ করার জন্য মূল্যায়ন ডেটা ব্যবহার করা থেকেও বাধা দেয় — লুপটি বন্ধ করে যার মাধ্যমে দূষণ সাধারণত ফিরে আসে।
কেন এটি এআই তদারকির জন্য গুরুত্বপূর্ণ
বৃহত্তর তাত্পর্য একটি মিথুন মডেলের বাইরে যায়। স্বাধীন সংস্থাগুলি - এআই সুরক্ষা ইনস্টিটিউট, একাডেমিক ল্যাব, নিয়ন্ত্রকগুলি - বদ্ধ সীমান্ত মডেলগুলির কঠোরভাবে মূল্যায়ন করার জন্য বছরের পর বছর ধরে সংগ্রাম করেছে, সঠিকভাবে কারণ প্রদানকারীরা ওজন হস্তান্তর করতে পারে না এবং মূল্যায়নকারীরা বেঞ্চমার্কগুলি হস্তান্তর করবে না। ফ্রন্টিয়ার ল্যাবগুলির সাথে মূল্যায়ন চুক্তি স্বাক্ষর করার সময় প্রতিটি বড় এআই সুরক্ষা ইনস্টিটিউট এই সমস্যার সংস্করণগুলির সাথে মোকাবিলা করেছে।
পাইলট ধরে রাখলে, এটি একটি টেমপ্লেট অফার করে যার অধীনে ডেটা সার্বভৌমত্ব এবং বুদ্ধিবৃত্তিক সম্পত্তি স্বাধীন যাচাইয়ের সাথে যোগাযোগ রক্ষা করে। ডিপমাইন্ড বলে যে এটি আশা করে যে পাইলট "মডেল তদারকির জন্য একটি নতুন সীমান্ত স্থাপন করবে, বৃহত্তর শিল্পকে নিরাপদ, আরও নির্ভরযোগ্য এবং ব্যাপকভাবে বিশ্বস্ত এআই সিস্টেম তৈরি করতে সহায়তা করবে।"
অংশীদার তালিকা নিজেই উল্লেখযোগ্য। সিঙ্গাপুর এআই সেফটি ইনস্টিটিউট হল সবচেয়ে সক্রিয় জাতীয় মূল্যায়ন সংস্থাগুলির মধ্যে একটি; OpenMined গোপনীয়তা-সংরক্ষণকারী গণনা টুলিং তৈরি করে; MLcommons শিল্প বেঞ্চমার্কিং মানসম্মত. AVERI একটি কনসোর্টিয়াম বিস্তৃত সরকার, একাডেমিয়া এবং শিল্পের মান সংস্থাগুলিকে বৃত্তাকার করে — যে নির্বাচনী এলাকাগুলিকে একটি প্রদর্শনের পরিবর্তে একটি আদর্শ হওয়ার জন্য দ্বি-অন্ধ মূল্যায়ন গ্রহণ করতে হবে৷
মূল্যায়ন সততার উপর একটি অস্ত্র রেস
এআই কোম্পানিগুলি কীভাবে নিজেদের গ্রেড করে তা নিয়ে ক্রমবর্ধমান যাচাই-বাছাইয়ের মধ্যে ঘোষণাটি আসে। ল্যাবগুলি চেরি-পিকিং অনুকূল বেঞ্চমার্কের ক্রমবর্ধমান অভিযোগের সম্মুখীন হয়, এবং স্বাধীন লিডারবোর্ডগুলি অবিকল প্রভাবশালী হয়ে উঠেছে কারণ তারা বিক্রেতাদের নিয়ন্ত্রণের বাইরে বসে। দ্বৈত-অন্ধ মূল্যায়ন বিক্রেতার নিজস্ব অবকাঠামোর ভিতরে সেই স্বাধীনতা আন্দোলনকে প্রসারিত করে - যে কোম্পানিগুলি ঐতিহাসিকভাবে তাদের মডেলগুলি কীভাবে পরীক্ষা করা হয় তার প্রতিটি বিস্তারিত নিয়ন্ত্রণের উপর জোর দিয়েছে তাদের জন্য একটি উল্লেখযোগ্য স্থানান্তর।
আপাতত, পাইলট একটি মডেল এবং গোপনীয় বেঞ্চমার্কের একটি সেট কভার করে। কিন্তু যদি ক্রিপ্টোগ্রাফিকভাবে যাচাই করা হয়, দূষণ-মুক্ত মূল্যায়ন টেকনিক্যালি রুটিন হয়ে যায়, তাহলে এটি প্রতিটি ফ্রন্টিয়ার ল্যাব থেকে এন্টারপ্রাইজ এবং নিয়ন্ত্রকেরা যা আশা করে তা পরিবর্তন করতে পারে - এবং যাচাইযোগ্য দাবির উপর ক্রমবর্ধমানভাবে নির্মিত একটি বাজারে "আমাদের স্কোরকে বিশ্বাস করা" একটি কঠিন বিক্রি করতে পারে।
---
এআই থেকে এগিয়ে থাকুনসর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।
আরও এআই খবর পড়ুন →