Anthropic এই সপ্তাহে তার নিজস্ব বিকাশের পাইপলাইনের মধ্যে একটি প্রথম ধরণের চেহারা প্রকাশ করেছে, প্রকাশ করেছে যে এর Claude মডেল এখন কোম্পানির AI গবেষণা ও উন্নয়ন কাজের 26% "নেতৃত্ব" করছে - যা 2026 সালের ফেব্রুয়ারিতে 1%-এর নিচে ছিল। পরিসংখ্যানগুলি একটি কোম্পানির ব্লগ পোস্টে প্রকাশিত হয়েছিল "এআই ডেভেলপমেন্টের গতি বোঝার জন্য পরিমাপ" শিরোনামের একটি কোম্পানির ব্লগ পোস্টে প্রকাশিত হয়েছে AI ডেভেলপমেন্টের ভিতরের একটি ল্যাব 7 দ্বারা প্রকাশিত। রয়টার্স, ওয়াশিংটন পোস্ট এবং অন্যান্য আউটলেট।

পোস্টটি আংশিকভাবে একটি স্বচ্ছতার অনুশীলন এবং আংশিকভাবে একটি যুক্তি: অ্যানথ্রোপিক চায় অন্যান্য ফ্রন্টিয়ার ল্যাবগুলি একই ধরণের সংখ্যা প্রকাশ করুক, যাতে জনসাধারণ এবং সরকারগুলি ট্র্যাক করতে পারে যে কত দ্রুত AI তৈরির চাবিগুলি হস্তান্তর করা হচ্ছে। For more context on this story, see our ongoing more AI stories.

এআই ডেভেলপমেন্ট ট্র্যাক করার জন্য তিনটি নম্বর

কোম্পানী তিনটি পরিমাপের প্রস্তাব করেছিল যে এটি বলে যে ফ্রন্টিয়ার ল্যাবগুলির অভ্যন্তরে বিকাশের গতি আলোকিত করে: AI নিজেই কতটা AI R&D সঞ্চালিত করে, AI এজেন্টদের ক্রিয়াগুলি কতটা ভালভাবে তত্ত্বাবধান করা হয় এবং কীভাবে সক্ষমতা কাজ এবং সুরক্ষা কাজের মধ্যে গণনা করা হয়।

শিরোনাম নম্বরটি আসে যাকে অ্যানথ্রোপিক তার R&D অটোমেশন সূচক বলে। কোম্পানিটি কোম্পানিতে করা প্রতিটি ধরনের AI R&D কাজ তালিকাভুক্ত করেছে, বর্তমানে প্রতিটি কাজ কতটা স্বয়ংক্রিয় তা রেট করেছে, এবং গবেষণা গ্রুপ Epoch AI দ্বারা তৈরি একটি স্কেল ব্যবহার করে ফলাফলগুলিকে একত্রিত করেছে। স্কেলটি AL0 (কোনও AI জড়িত নেই) থেকে AL5 পর্যন্ত চলে (AI সম্পূর্ণ স্বায়ত্তশাসিতভাবে কাজ করে, লুপে কোন মানুষ নেই), সঙ্গে AL3 মানে AI "সহযোগীতা করে" মানুষের কাছাকাছি মানুষের নির্দেশনায় এবং AL4 মানে AI "লিড", একটি উচ্চ-স্তরের সুপার প্রম্পট থেকে শেষ থেকে শেষ পর্যন্ত বেশিরভাগ কাজ সম্পন্ন করে।

আগস্ট 2026 পর্যন্ত, অ্যানথ্রপিক রিপোর্ট করেছে, ক্লড কোম্পানির AI R&D কাজের 26% নেতৃত্ব দেয়। "AI collaborates" স্তরে বা তার উপরে কাজের ভাগ 90% এর উপরে। AI R&D কাজের পরিমাপ করা উপসেটের জন্য Claude সম্পূর্ণ স্বায়ত্তশাসিতভাবে কাজ করছে না।

30,000 এজেন্ট, একটি মনিটর

দ্বিতীয় পরিমাপ তত্ত্বাবধান উদ্বেগ. অ্যানথ্রোপিক প্রকাশ করেছে যে আগস্ট 2026 পর্যন্ত প্রায় 30,000 এজেন্ট কোম্পানিতে গবেষণা ও প্রকৌশলের কাজ করছেন যে কোনো সময়ে তার সবচেয়ে বেশি ব্যবহৃত অভ্যন্তরীণ প্ল্যাটফর্মে।

পোস্ট অনুসারে, এই এজেন্টদের প্রতিটি কাজ একটি অনলাইন মনিটরের মাধ্যমে সম্পাদন করার আগে, সাধারণত সেকেন্ডের মধ্যে পাস করে। অ্যানথ্রপিক বলছে যে এটি আগস্ট মাসে তার গবেষণা এবং প্রকৌশল এজেন্টদের কাছ থেকে এক বিলিয়নেরও বেশি সিদ্ধান্ত বিশ্লেষণ করেছে এবং দেখেছে যে মনিটরদের দ্বারা অবরুদ্ধ বা বর্ধিত কার্যকলাপের ভাগ 0.002% ছিল।

গণনা বরাদ্দের বিষয়ে, তৃতীয় পরিমাপ, সংস্থাটি বলেছে যে পরীক্ষিত সপ্তাহে AI R&D-এ যাওয়া গণনার প্রায় 6% নিরাপত্তার জন্য বরাদ্দ করা হয়েছিল।

নিজের উত্তরসূরি তৈরি করা — মানুষের তত্ত্বাবধানে

ফ্রেমিং পরিসংখ্যান হিসাবে অনেক গুরুত্বপূর্ণ. নৃতাত্ত্বিক মডেলগুলি একই মডেলগুলির পরবর্তী প্রজন্ম তৈরিতে ক্রমবর্ধমানভাবে অংশগ্রহণ করছে — যাকে গবেষকরা পুনরাবৃত্ত স্ব-উন্নতি বলে এবং ওয়াশিংটন পোস্টের শিরোনামটি একটি চ্যাটবট হিসাবে আরও স্পষ্টভাবে বর্ণনা করেছে "নিজের উত্তরসূরি তৈরির কাজ গ্রহণ করা।"

নৃতাত্ত্বিক "এআই লিড" এবং "এআই প্রতিস্থাপন" এর মধ্যে একটি রেখা আঁকতে সাবধান। AL4 এ, একজন মানুষ এখনও তত্ত্বাবধান করে এবং হস্তক্ষেপ করতে পারে; কোম্পানি স্পষ্টভাবে রিপোর্ট করেছে যে তার R&D কাজের কোনো পরিমাপিত উপসেট AL5 এ চলে না। তবে গতিপথ খাড়া: মোটামুটি সাত মাসে 1% থেকে 26%-এর নিচে যাওয়া থেকে বোঝা যায় যে বর্তমান প্রবণতা ধরে রাখলে এআই-নেতৃত্বাধীন কাজের অংশটি দশকের শেষের আগে অর্ধেক ভাল হয়ে যেতে পারে।

পদ্ধতির বাস্তব সীমা আছে, এবং নৃতাত্ত্বিক তাই বলে। এর অটোমেশন রেটিংগুলি কোম্পানির নিজস্ব কাজের রেকর্ডের নমুনা নিয়ে তৈরি করা হয়েছিল — স্ল্যাক বার্তা এবং অভ্যন্তরীণ ডকুমেন্টেশন সহ — এবং প্রতিটি কাজ কতটা স্বয়ংক্রিয় হয় তা মানুষ এবং একজন বিচারক মডেল রেট করে। একটি অন্ধ পরীক্ষায়, কর্মীরা মডেলগুলি কী প্রমাণ সংগ্রহ করেছে তা না জেনেই কাজগুলিকে রেট দিয়েছে৷ কোম্পানী জানিয়েছে যে তার মডেল বিচারক মানুষের সাথে সম্মত হয়েছেন যতবার মানুষ একে অপরের সাথে সম্মত হয়েছে: সঠিক মডেল থেকে মানব চুক্তি ছিল 59%, যখন মানুষ থেকে মানুষ চুক্তি ছিল মাত্র 35%, এবং মডেল এবং মানুষের রেটিং একে অপরের 97% সময়ের মধ্যে একটি স্তরের মধ্যে অবতরণ করে৷

কোম্পানিটি তার নিজস্ব পদ্ধতিতে স্ব-উল্লেখযোগ্য ঝুঁকিও স্বীকার করেছে: অ্যানথ্রোপিক তার সিস্টেমগুলিকে মূল্যায়ন করতে সাহায্য করার জন্য তার নিজস্ব মডেলগুলি ব্যবহার করেছে, যার অর্থ হতে পারে বিচারক মডেলটি যে মডেলটি পরীক্ষা করছে তার মতোই ত্রুটিগুলি করে৷ তৃতীয় পক্ষের যাচাইকরণ, এটি যুক্তি দেয়, আসল উত্তর।

বাইরে চোখ আসছে

সেই লক্ষ্যে, অ্যানথ্রপিক বলেছে যে এটি কোম্পানির অভ্যন্তরে একাধিক সংস্থার স্বাধীন তৃতীয় পক্ষের মূল্যায়নকারীদের এম্বেড করার পরিকল্পনা করছে, তাদের অভ্যন্তরীণ প্রক্রিয়া, সিস্টেম এবং ডেটাতে অ্যাক্সেস দেবে যা অভ্যন্তরীণ ঝুঁকি মূল্যায়ন দলগুলির সাথে তুলনীয়। বাহ্যিক AI গবেষণা অলাভজনক METR পূর্বে রেড-টিম অ্যানথ্রপিকের অফলাইন পর্যবেক্ষণ প্ল্যাটফর্ম করেছে।

পেসিং সম্পর্কে একটি ক্রমবর্ধমান বিতর্কের মধ্যে প্রকাশটি আসে। নৃতাত্ত্বিক সিইও দারিও আমোডেই সীমান্তকে ধীরগতির বিষয়ে সমন্বয়ের আহ্বান জানিয়েছেন এবং সংস্থাটি নোট করেছে যে এই ধরনের সমন্বয় বিদ্যমান থাকলে তার নিজস্ব সংখ্যাগুলি স্থানান্তরিত হবে বলে আশা করা হবে। এই সপ্তাহে, অ্যানথ্রোপিক এবং ওপেনএআইও নিরাপত্তা বিশেষজ্ঞদের একটি পাবলিক চিঠির বিষয় ছিল যে যুক্তি দিয়ে যে ল্যাবগুলির সত্যই স্বাধীন নিরাপত্তা মূল্যায়নকারীদের প্রয়োজন।

প্রতিদ্বন্দ্বীরা অ্যানথ্রপিকের নেতৃত্ব অনুসরণ করে কিনা তা খোলা প্রশ্ন। সংস্থাটি যুক্তি দেয় যে কোনও সীমান্ত বিকাশকারী একটি পাবলিক পদ্ধতি ব্যবহার করে এই ব্যবস্থাগুলি নিয়মিত প্রকাশ করতে পারে। তারা না করা পর্যন্ত, AI কত দ্রুত AI তৈরি করছে তার একমাত্র পাবলিক নম্বর ল্যাব থেকে আসে।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →