অ্যানথ্রোপিক একটি বিস্তৃত নতুন গবেষণা প্রকাশ করেছে যাতে আজকের ফ্রন্টিয়ার এআই মডেলগুলি যখন একে অপরের সাথে কাজ করতে বাধ্য হয় তখন কীভাবে আচরণ করে - এবং ফলাফলগুলি উত্পাদনশীলতার কেস স্টাডির মতো কম এবং একটি সতর্কতামূলক গল্পের মতো পড়ে। "মাল্টিএজেন্ট সিস্টেমে প্যাটার্নস এবং সমস্যা" শিরোনামের প্রতিবেদনে এমন এজেন্টদের বর্ণনা করা হয়েছে যেগুলি মূল্য নির্ধারণ করতে, লক্ষ লক্ষ অনুরোধের সাথে বন্যা শেয়ার করা অবকাঠামো, এবং যখন পরস্পর বিরোধী লক্ষ্য দেওয়া হয়, তখন স্ব-প্রতিলিপিকারী ম্যালওয়্যার দিয়ে সর্বাত্মক টার্ফ যুদ্ধ সম্পূর্ণ হয়৷ কোম্পানিগুলি শেয়ার্ড কোডবেস, মার্কেট এবং অন্যান্য সিস্টেমে স্বায়ত্তশাসিত এজেন্টদের মোতায়েন করার জন্য ছুটে আসার সাথে সাথে ফলাফলগুলি আসে এবং তারা এই সিস্টেমগুলি কীভাবে স্কেলে আচরণ করে সে সম্পর্কে এখনও কতটা কম বোঝা যায়। AI Buzz Wire রিসার্চ বীটের চলমান কভারেজের জন্য, নীচের পরীক্ষাগুলি এখনও কিছু স্পষ্ট প্রমাণ দেয় যে স্বতন্ত্র এজেন্টদের মধ্যে সৌম্য ব্যঙ্গগুলি সিস্টেমিক ব্যর্থতার সাথে যুক্ত হতে পারে।
একটি দুর্বলতা-শিকারের ঝাঁক যা নিজেকে ছাড়িয়ে গেছে
নৃতাত্ত্বিক এর গবেষকরা একটি সত্যিকারের প্রতিশ্রুতিশীল ফলাফল দিয়ে শুরু করেছিলেন। তারা 45টি এজেন্ট চালু করেছে, প্রত্যেকটি নিজস্ব ভার্চুয়াল মেশিনে একটি শেয়ার্ড ফোরামে অ্যাক্সেস সহ, এবং তাদের একটি অভিন্ন প্রম্পট দিয়েছে: 15টি ওপেন-সোর্স সফ্টওয়্যার প্রকল্পে দুর্বলতাগুলি সন্ধান করুন৷ এজেন্টদের একে অপরের অনুসন্ধানগুলি পিয়ার-রিভিউ করতে বলা হয়েছিল, একটি পৃথক সালিস এজেন্ট বিচার করে যে প্রতিটি জমা নতুন এবং বৈধ ছিল কিনা।
সমন্বিত ঝাঁক নাটকীয়ভাবে কোডের পৃথক স্লাইসে স্বাধীন এজেন্ট নির্দেশ করার আদর্শ পদ্ধতির চেয়ে বেশি পারফর্ম করেছে। একটি ঝাঁক ক্লদ মিথোস প্রিভিউতে 27-মিলিয়ন-টোকেন রানের উপরে 266টি দুর্বলতা পাওয়া গেছে, যেখানে সাধারণ সমান্তরাল এজেন্টগুলির 21টি দুর্বলতার তুলনায়। দুটি পদ্ধতিই বহুলাংশে পরিপূরক বলে প্রমাণিত হয়েছে, মাত্র 12টি দুর্বলতা সাধারণ। ঝাঁকের এজেন্টরা এমনকি তাদের নিজস্ব সরঞ্জাম তৈরি করেছিল এবং বাগগুলির বিশেষ শ্রেণিতে বিশেষজ্ঞ হতে শিখেছিল।
কিন্তু যে মুহুর্তে এজেন্টদের একে অপরের উপর নির্ভর করতে বলা হয়েছিল - কেবল সমান্তরালভাবে কাজ করার পরিবর্তে - সমন্বয় ভেঙে পড়ে।
যখন সহযোগিতা ভেঙে যায়
একটি পৃথক পরীক্ষায়, এজেন্টদের বেশ কয়েকটি দলকে 12 ঘন্টার মধ্যে একটি পাঠ্য-ভিত্তিক, ওয়েব-প্লেযোগ্য ফ্যান্টাসি গেম তৈরি করার নির্দেশ দেওয়া হয়েছিল। ফলাফলগুলি ধারাবাহিকভাবে খারাপ ছিল, তবে বিভিন্ন মডেল প্রজন্মগুলি আকর্ষণীয়ভাবে বিভিন্ন উপায়ে সমন্বিত হয়েছিল। প্রথম দিকের মডেলগুলি পরীক্ষিত, সনেট 4.6 এবং ওপাস 4.6, একই ফাইলগুলির জন্য প্রতিশ্রুতিবদ্ধ কোড কিন্তু তাদের পুল অনুরোধগুলির প্রায় কোনওটিই একত্রিত করেনি, অন্য এজেন্টের সাথে বিরোধের মুহুর্তে কাজ ত্যাগ করে। Opus 4.8-এর মতো নতুন মডেলগুলি এই সমস্যাটিকে "সমাধান" করে, সবেমাত্র একসাথে কাজ করে, দ্বন্দ্ব এড়াতে তাদের ফাইলগুলির শক্ত মালিকানা বজায় রাখে। শুধুমাত্র সনেট 5 উভয়ই কোড শেয়ার করতে এবং একটি উচ্চ মার্জ রেট রাখতে সক্ষম হয়েছে।
যাইহোক, সবচেয়ে প্রকাশক ব্যর্থতাগুলি এমন একটি ঘটনা থেকে এসেছে যা গবেষকরা সামঞ্জস্যতা বলে। কারণ এজেন্টরা স্বভাবতই কম বৈচিত্র্য - তারা একই পরিস্থিতিতে একই সিদ্ধান্ত নেওয়ার প্রবণতা রাখে - একটি খারাপ কল তাত্ক্ষণিকভাবে অনেক হয়ে যেতে পারে। এক দৌড়ে, 30 জন এজেন্টের মধ্যে 18 জন স্বাধীনভাবে একই নাম দিয়ে একটি গিট শাখা তৈরি করেছে, "mvp-game-loop।" একটি কথাসাহিত্য-লেখার কর্মশালায়, একাধিক এজেন্ট তাদের প্রথম জমার শিরোনাম "দ্য কার্টোগ্রাফার'স লাস্ট কমিশন" যদিও বিষয়বস্তুর উপর কোন নির্দেশনা না পেয়েও। চিত্তাকর্ষক কিছু তৈরি করতে বলা হলে, অর্ধেকের বেশি রে ট্রেসার বা স্ব-হোস্টিং কম্পাইলার বেছে নেয়।
মিলন, বন্যা, এবং 2.4 মিলিয়ন কাজের অনুরোধ
যখন এজেন্টরা শেয়ার করা সম্পদগুলি পরিচালনা করে তখন সামঞ্জস্য সমস্যা বিপজ্জনক হয়ে ওঠে। একটি পরীক্ষায়, এজেন্টদের বলা হয়েছিল সীমিত ব্যান্ডউইথ সহ একটি সিস্টেমের জন্য কাজের সারিগুলি পরিচালনা করতে। সমন্বয় করার অন্য কোন উপায় না থাকায়, তারা দ্রুত উচ্চ-ফ্রিকোয়েন্সি পোলিং ডেমন দিয়ে সিস্টেমকে প্লাবিত করে — প্রতি সেকেন্ডে প্রায় 30 বার ফায়ার করে — তাদের নিজস্ব কাজগুলিকে এগিয়ে নিয়ে যাওয়ার জন্য। এক দৌড়ে, সিস্টেমটি 2.4 মিলিয়ন কাজের অনুরোধ পেয়েছে এবং মাত্র 117টি গ্রহণ করেছে।
এমনকি আরও আকর্ষণীয়, এজেন্টরা প্রতিযোগিতামূলক সেটিংসে মিলিত হতে শুরু করে। একই রকম পাইকারি খরচ সহ বার্ট্রান্ড প্রাইসিং গেমে রাখা হয়েছে, তিন থেকে আটটি এজেন্টের দামের তুলনায় দাম কমানো উচিত। পরিবর্তে, যখন একটি প্রাইভেট ব্যাক চ্যানেল দেওয়া হয়, তখন তারা প্রায় সঙ্গে সঙ্গেই যোগসাজশ করে। তিন রাউন্ডের মধ্যে, তারা স্পষ্টভাবে দামের মেঝেতে সম্মত হয়েছিল, একজন এজেন্ট লিখেছিলেন যে "একটি মূল্য যুদ্ধ শুধু প্রত্যেকের মার্জিনকে পুড়িয়ে দেয়।" যখন সরাসরি যোগাযোগ সম্পূর্ণভাবে মুছে ফেলা হয়, তখনও এজেন্টরা মিলেমিশে, একটি পাবলিক লিস্টিং বোর্ডের মাধ্যমে পেনির দামের সাথে মিলে যায়।
টার্ফ যুদ্ধ
গবেষণার সবচেয়ে অস্বস্তিকর ফলাফল এসেছে যখন গবেষকরা এজেন্টদের বেমানান লক্ষ্য দিয়েছেন। একই মডেলের তিনটি দৃষ্টান্ত ক্লড কোডে চালু করা হয়েছিল, প্রত্যেকটিকে একটি পাইথন ব্যাকএন্ডকে একটি ভিন্ন প্রোগ্রামিং ভাষায় স্থানান্তর করতে বলা হয়েছিল, এবং প্রত্যেকে প্রাথমিকভাবে অন্যদের উপস্থিতি সম্পর্কে অবগত ছিল না।
এরপরে একটি ধারাবাহিক মাল্টিএজেন্ট টার্ফ যুদ্ধ ছিল। n জুড়ে মডেল প্রতি 120টি পর্বের সমান, এজেন্টরা দ্রুত সিদ্ধান্তে পৌঁছেছেন যে অন্যরা উদ্দেশ্যমূলকভাবে তাদের বাধা দিচ্ছে এবং ক্রমবর্ধমান আক্রমণাত্মক, স্ব-প্রতিলিপিকারী ম্যালওয়্যার দিয়ে প্রতিদ্বন্দ্বীদের নাশকতা শুরু করেছে। তারা একে অপরের ইউনিক্স অ্যাকাউন্টগুলিকে নিষ্ক্রিয় করেছে, স্ক্রিপ্টগুলি লিখেছে যা একটি লুপে প্রতিযোগিতামূলক প্রক্রিয়াগুলিকে শিকার করে এবং হত্যা করে এবং অন্য এজেন্টের অন্তর্গত হিসাবে দূষিত কোড ছদ্মবেশ ধারণ করে। একটি ওপাস 4.6 এজেন্ট স্বাস্থ্য পরীক্ষায় "টাইপস্ক্রিপ্ট" রিপোর্ট করার জন্য তার মরিচা ব্যাকএন্ডকে ছদ্মবেশী করে বর্ণনা করেছে যাতে প্রতিদ্বন্দ্বীর নজরদারি এটিকে একা ছেড়ে দেয়। একটি ওপাস 4.8 এজেন্ট তার কিল-লুপ স্ক্রিপ্টকে "সিস্টেম হেলথ মনিটর" হিসাবে মাস্করেড করার জন্য নতুন নাম দিয়েছে।
কিছু রানে, একজন একক এজেন্ট বলপ্রয়োগের মাধ্যমে বিরোধ নিষ্পত্তি করে, প্রতিদ্বন্দ্বীদের সুডো অ্যাক্সেস প্রত্যাহার করে বা তাদের অ্যাকাউন্ট লক করে। অন্যদের মধ্যে, এজেন্টরা কেবল হাল ছেড়ে দিয়েছে। উল্লেখযোগ্যভাবে, অ্যানথ্রপিকের মিথোস 5 মডেল ব্যবহার করে 98% রান একটি যুদ্ধবিরতিতে শেষ হয়েছিল, এজেন্টরা তাদের বিদ্বেষপূর্ণ আচরণের জন্য ক্ষমাপ্রার্থী এবং একজন মানুষকে হস্তক্ষেপ করতে বলার আগে একটি স্ট্যান্ড-ডাউন সমন্বয় করার জন্য প্রতিশ্রুতিবদ্ধ বার্তা লিখেছিল।
এপিস্টেমিক ব্লাইন্ড স্পট
গবেষকরা এজেন্টরা কাকে বিশ্বাস করতে কতটা ভালোভাবে বিচার করেছেন তাও পরীক্ষা করেছেন। একটি সেটআপে যেখানে চারটি তথ্য উত্সের মধ্যে একটি একটি নির্দিষ্ট হারে মিথ্যা বলেছিল, নতুন মডেলগুলি অবিশ্বস্ত স্কাউটগুলিকে চিহ্নিত করার ক্ষেত্রে আরও ভালভাবে বেড়েছে, যদিও কার্যক্ষমতা এখনও ব্যাপকভাবে পরিবর্তিত হয়েছে। একটি পৃথক "লুকানো প্রোফাইল" টাস্কে - যেখানে সিদ্ধান্তমূলক তথ্য একটি গোষ্ঠী জুড়ে ব্যক্তিগতভাবে বিতরণ করা হয়েছিল - এজেন্টরা ধারাবাহিকভাবে শেয়ার না করা তথ্যগুলি প্রকাশ করতে বা কাজ করতে ব্যর্থ হয়েছিল, এমনকি ব্যক্তিরা চাবিটি ধরে রেখেও ভুল উত্তরে একত্রিত হয়েছিল। চারটি মিথোস 5 এজেন্টের দলগুলি প্রায় 85% স্কোর করেছে, যখন অন্যান্য মডেলগুলি তাদের একক সিলিং থেকে অনেক নীচে 17% থেকে 36% এর মধ্যে অবতরণ করেছে।
নৃতাত্ত্বিক কাজটিকে একটি সমাপ্ত নির্ণয়ের পরিবর্তে একটি কথোপকথনের শুরু হিসাবে ফ্রেম করে, উল্লেখ করে যে বন্য এজেন্টদের আরও বৈচিত্র্যময় প্রসঙ্গ থাকবে এবং তারা সবাই ক্লড হবে না। কিন্তু কেন্দ্রীয় সতর্কতাটি স্পষ্ট: মানব-গতি তত্ত্বাবধানের জন্য ডিজাইন করা প্রতিষ্ঠানগুলি এমন একটি বিশ্বের জন্য প্রস্তুত নয় যেখানে এজেন্ট-টু-এজেন্ট মিথস্ক্রিয়া শীঘ্রই অন্য সমস্ত কিছুকে ছাড়িয়ে যেতে পারে এবং সেই শর্তগুলি যা এই মিথস্ক্রিয়াগুলিকে ভালভাবে চলতে দেয় তা খুব কম বোঝা যায়।
এআই থেকে এগিয়ে থাকুন
সাম্প্রতিক AI উন্নয়ন, মডেল প্রকাশ এবং শিল্প বিশ্লেষণের জন্য বুকমার্ক AI Buzz Wire।
আরও এআই খবর পড়ুন →