অ্যানথ্রোপিক শনিবার স্ব-পরিমাপের একটি বিশদ সেট প্রকাশ করেছে যা জনসাধারণ, সাংবাদিক এবং সরকারগুলিকে ট্র্যাক করতে দেওয়ার উদ্দেশ্যে প্রকাশ করেছে যে AI আসলে কতটা দ্রুত সীমানা বিকশিত হচ্ছে — যার মধ্যে একটি প্রথম ধরণের সূচক রয়েছে যে কোম্পানির নিজস্ব গবেষণা এখন AI দ্বারা সঞ্চালিত হচ্ছে, এবং এই প্রকাশ যে মোটামুটি 30,000 AI এজেন্ট যে কোনও কোম্পানির ভিতরে গবেষণা করছে এবং ইঞ্জিনে কাজ করছে।
"ফ্রন্টিয়ার ল্যাবগুলির ভিতরে এআই বিকাশের গতি বোঝার জন্য পরিমাপ" শিরোনামের পোস্টটি শিল্পের সবচেয়ে পরিণত যুক্তির কেন্দ্রে পৌঁছেছে: সীমান্তের বিকাশ ইচ্ছাকৃতভাবে ধীর করা উচিত কিনা। দারিও আমোদেই "সীমান্ত গতিতে" সমন্বয়ের আহ্বান জানিয়েছেন, এমন একটি প্রস্তাব যা বাজারকে নাড়া দিয়েছে, প্রধান ল্যাবগুলির মধ্যে পেসিং যোগসাজশের অভিযোগে একটি ভোক্তা মামলা করেছে এবং রাষ্ট্রপতি ট্রাম্পকে যে কোনও মন্থরতা রোধ করতে নিবেদিত একটি "এআই ফোর্স" ঘোষণা করতে প্ররোচিত করেছে। নৃতাত্ত্বিক এর ফ্রেমিং সেই প্রেক্ষাপট সম্পর্কে সুস্পষ্ট: "বিশ্ব যেহেতু সীমানা AI উন্নয়নের গতিকে ধীর করার কথা বিবেচনা করে, জনসাধারণের আরও তথ্যের প্রয়োজন।"
এআই অগ্রগতি ট্র্যাক করার জন্য তিনটি পরিমাপ
সংস্থাটি তিনটি পরিমাপের ক্ষেত্র তৈরি করেছে যা এটি যুক্তি দেয় যে কোনও সীমান্ত ল্যাব নিয়মিত প্রকাশ করতে পারে:
1। AI নিজেই কতটা AI R&D সঞ্চালিত করে। অ্যানথ্রপিক কোম্পানিতে করা প্রতিটি ধরনের AI গবেষণা ও উন্নয়ন কাজের ক্যাটালগ করে, বর্তমানে প্রতিটি কাজ কতটা স্বয়ংক্রিয় তা রেটিং করে এবং ফলাফলগুলিকে একত্রিত করে একটি প্রোটোটাইপ "Anthropic R&D অটোমেশন ইনডেক্স" তৈরি করেছে। রেটিংগুলি Epoch AI-এর সর্বজনীন "অটোমেশন লেভেল" স্কেল ব্যবহার করে, যা AL0 (কোনও AI জড়িত নেই) থেকে AL5 পর্যন্ত চলে (এআই লুপে কোনও মানুষ ছাড়াই সম্পূর্ণ স্বায়ত্তশাসিতভাবে কাজ করে)। এই স্কেলে, AL3 মানে AI "সহযোগিতা করে" — মানুষের কাছাকাছি মানুষের নির্দেশনায় কাজ করার বড় অংশগুলি করে — যখন AL4 মানে AI "নেতৃত্ব দেয়", একটি উচ্চ-স্তরের প্রম্পট থেকে শেষ থেকে শেষের বেশিরভাগ কাজ সম্পন্ন করে যখন একজন মানুষ তত্ত্বাবধান করে।সূচকের বিন্দু হল পরিমাপ করা যে কোনও ল্যাব পুনরাবৃত্ত স্ব-উন্নতির কতটা কাছাকাছি যাচ্ছে — একটি মডেল সম্পূর্ণ স্বায়ত্তশাসিতভাবে তার নিজস্ব উত্তরসূরি তৈরি করে। অ্যানথ্রোপিক নোট করে যে AI বিকাশকে ত্বরান্বিত করে এমন মডেলগুলি "মানুষের জন্য এই সিস্টেমগুলি বোঝা বা নিয়ন্ত্রণ করা আরও চ্যালেঞ্জিং করে তুলতে পারে।"
2। এআই এজেন্টদের কর্মকাণ্ড কতটা ভালোভাবে পর্যবেক্ষণ করা হয়। এখানেই 30,000 চিত্রটি প্রদর্শিত হয়। 2026 সালের আগস্ট পর্যন্ত, প্রায় 30,000 এজেন্ট অ্যানথ্রপিকের সর্বাধিক ব্যবহৃত অভ্যন্তরীণ প্ল্যাটফর্মের ভিতরে যে কোনও সময়ে গবেষণা এবং প্রকৌশলের কাজ করছিলেন, একে অপরের কাছে কাজগুলি অর্পণ করেছিলেন এবং দীর্ঘ প্রসারিত জন্য আধা-স্বায়ত্তশাসিতভাবে কাজ করেছিলেন। কোম্পানি সেই এজেন্টদের তত্ত্বাবধানের বিষয়ে তিনটি বিষয় পরিমাপ করে: কভারেজ (এজেন্ট ক্রিয়াগুলির ভাগ যা একটি মনিটরের মধ্য দিয়ে সঞ্চালনের আগে বা পরে যায়), পর্যালোচনা লেটেন্সি (কত দ্রুত পতাকাঙ্কিত ক্রিয়াগুলি পর্যালোচনা করা হয়, প্রথমে একটি স্বয়ংক্রিয় মনিটর দ্বারা এবং তারপরে একজন মানুষের দ্বারা), এবং বৃদ্ধির হার (অবরুদ্ধ করা, পুনঃনির্দেশিত বা পর্যালোচনার জন্য পতাকাঙ্কিত কার্যকলাপের ভাগ)।অ্যানথ্রোপিকের মনিটরিং ডেটা এখনও পর্যন্ত পৃথক এজেন্টদের খুব কমই খারাপ আচরণের পরামর্শ দেয় - তবে সংস্থাটি সতর্ক করে যে "যখন অর্থনীতিতে লক্ষ লক্ষ বা বিলিয়ন এজেন্ট কাজ করে, এমনকি বিরল ঘটনাও নিয়মিত ঘটতে পারে।"
3। কিভাবে কম্পিউট বরাদ্দ করা হয়। তৃতীয় পরিমাপ ট্র্যাক করে কিভাবে ল্যাবের কম্পিউটিং সংস্থানগুলি বিতরণ করা হয় — কাঁচা ইনপুট যা মডেলের ক্ষমতার সাথে সম্পর্কযুক্ত। অন্য দুটি মেট্রিক্সের সাথে একত্রে, অ্যানথ্রপিক যুক্তি দেয় যে এটি বহিরাগতদের মডেল আউটপুটগুলির সাথে মডেল ইনপুটগুলিকে সম্পর্কযুক্ত করার একটি উপায় দেয়, কোম্পানিটি ইতিমধ্যেই তার দায়িত্বশীল স্কেলিং নীতি ঝুঁকি প্রতিবেদনের মাধ্যমে প্রকাশ করা সক্ষমতা মূল্যায়নের পরিপূরক।সংখ্যা একটি মন্থর অধীনে সরানো হবে
পোস্টের সবচেয়ে রাজনৈতিকভাবে নির্দেশিত লাইনটি সরাসরি পেসিং বিতর্কের দিকে লক্ষ্য করা হয়েছে: অ্যানথ্রোপিক বলে যে এটি "অ্যান্থ্রোপিক সিইও দারিও অ্যামোডির আহ্বান অনুযায়ী, সীমানা গতিতে সমন্বয় থাকলে এই সংখ্যাগুলি পরিবর্তন হবে বলে আশা করবে।" অন্য কথায়, যদি শিল্পটি সত্যিকার অর্থে ধীর হয়ে যায়, তাহলে এই মেট্রিকগুলি হল জনগণ কীভাবে এটি যাচাই করতে পারে — এবং যদি কোম্পানিগুলি দাবি করে যে তাদের সংখ্যা বাড়তে থাকা অবস্থায় গতিশীল হচ্ছে, পরিমাপগুলিও তা প্রকাশ করবে।
স্বাধীন যাচাইকরণটি অনুপস্থিত অংশ
নৃতাত্ত্বিক স্ব-প্রতিবেদিত মেট্রিক্সের কেন্দ্রীয় দুর্বলতা স্বীকার করে: এটি তার নিজস্ব সিস্টেমগুলি মূল্যায়ন করার জন্য তার নিজস্ব মডেলগুলি ব্যবহার করছে, যার মানে "বিচারক" মডেলটি পরীক্ষা করা মডেলের অন্ধ দাগগুলি ভাগ করতে পারে৷ কোম্পানিটি ল্যাব জুড়ে একটি সাধারণ পদ্ধতির অভাবকেও নোট করে, তুলনা করা কঠিন করে তোলে।
এর প্রস্তাবিত প্রতিকার হল অ্যানথ্রোপিকের ভিতরে একাধিক সংস্থার স্বাধীন তৃতীয় পক্ষের মূল্যায়নকারীদের এম্বেড করা, তাদের অভ্যন্তরীণ প্রক্রিয়া, সিস্টেম এবং ডেটাতে অ্যাক্সেস দেওয়া যা অভ্যন্তরীণ ঝুঁকি মূল্যায়ন দলগুলি দেখে তার সাথে তুলনা করা যায়। যারা তৃতীয় পক্ষ নিরাপত্তা অনুশীলন যাচাই করবে, ঘটনা রিপোর্ট করবে, এবং নতুন মেট্রিক্স নিরীক্ষণ করবে। কোম্পানি বলছে, METR, মূল্যায়ন অলাভজনক, এর আগে স্বাধীনভাবে তার অফলাইন মনিটরিং প্ল্যাটফর্মকে লাল-টিম করেছে, এবং এটি এই পরিমাপগুলিকে নিয়মিতভাবে প্রকাশ করার পরিকল্পনা করছে যাতে অন্যরা যাচাই করতে পারে৷
পরিমাপগুলি অ্যানথ্রপিকের বৃহত্তর অ্যাডভান্সড এআই ফ্রেমওয়ার্ক প্রস্তাবের সাথে যুক্ত, যা সীমান্ত মডেল প্রকাশের জন্য "রাস্তার নিয়ম" তৈরি করে, যার মধ্যে স্বচ্ছতার বাধ্যবাধকতা রয়েছে যা সরকারগুলির প্রয়োজন হতে পারে — যেমন স্ট্যান্ডার্ডাইজড ঝুঁকি রিপোর্ট।
পুরো শিল্পের জন্য একটি পরীক্ষা
পদের গভীর তাৎপর্য প্রতিযোগিতামূলক হতে পারে। নৃতাত্ত্বিক কার্যকরভাবে প্রতিটি সীমান্ত ল্যাবকে একই সংখ্যা প্রকাশ করার জন্য চ্যালেঞ্জ করছে, এই যুক্তিতে যে "যেকোন সীমান্ত বিকাশকারী একটি পাবলিক পদ্ধতি ব্যবহার করে এই ব্যবস্থাগুলি নিয়মিত প্রকাশ করতে পারে।" যদি প্রতিদ্বন্দ্বীরা হ্রাস পায়, তবে বৈপরীত্য নিরাপত্তা বিতর্কে তার নিজস্ব ডেটা পয়েন্টে পরিণত হয়; যদি তারা সম্মত হয়, শিল্পটি প্রথম সাধারণ মানদণ্ড লাভ করে যে AI সত্যিই কত দ্রুত অগ্রসর হচ্ছে।
আপাতত, পেসিং কথোপকথনে একটি সুস্পষ্ট আগ্রহ সহ একটি কোম্পানির দ্বারা সংখ্যাগুলি স্ব-প্রতিবেদন করা হয়েছে৷ কিন্তু তারা এমন কিছুর প্রতিনিধিত্ব করে যা বিতর্কের অভাব রয়েছে: কংক্রিট, পুনরাবৃত্তিযোগ্য পরিমাপ যা দেখায় যে সীমান্তটি ত্বরান্বিত হচ্ছে, স্থির আছে বা আসলেই ধীর হচ্ছে কিনা।
এআই থেকে এগিয়ে থাকুন
এই এক জমি সাপ্তাহিক মত ফ্রন্টিয়ার ল্যাব প্রকাশ. আরও ব্রেকিং AI গবেষণা এবং শিল্প কভারেজের জন্য, AI Buzz Wire অনুসরণ করুন।
সর্বশেষ AI খবর পড়ুন →