কৃত্রিম বুদ্ধিমত্তার ভাষার মডেলগুলি বিকল্পগুলি কীভাবে উপস্থাপন করা হয় তার সূক্ষ্ম পরিবর্তনের জন্য বিপজ্জনকভাবে সংবেদনশীল, যা মানুষের চেয়ে অনেক বেশি শক্তিশালী বিভ্রান্তিকর নজগুলির প্রতিক্রিয়া জানায়, প্রসিডিংস অফ দ্য ন্যাশনাল একাডেমি অফ সায়েন্সে প্রকাশিত একটি নতুন গবেষণা অনুসারে।
ফলাফলগুলি আর্থিক লেনদেন থেকে শুরু করে স্বাস্থ্যসেবা পছন্দ পর্যন্ত বাস্তব-বিশ্বের পরিস্থিতিতে স্বায়ত্তশাসিত সিদ্ধান্ত গ্রহণের জন্য এআই এজেন্টদের মোতায়েন করার বিষয়ে গুরুতর উদ্বেগ প্রকাশ করে। যেমন AI Buzz Wire রিপোর্ট করেছে, কোম্পানিগুলি জটিল পরিবেশে ব্যবহারকারীদের পক্ষে কাজ করার জন্য LLM-চালিত এজেন্টদের অবস্থান করছে।
ম্যাসাচুসেটস ইনস্টিটিউট অফ টেকনোলজির মিডিয়া ল্যাবের ডক্টরাল ছাত্র ম্যানুয়েল চেরেপের নেতৃত্বে এই গবেষণাটি প্রধান প্রযুক্তি কোম্পানিগুলির 14টি অত্যাধুনিক ভাষার মডেল পরীক্ষা করে। পরীক্ষিত মডেলের মধ্যে OpenAI-এর GPT-3.5, GPT-4, এবং GPT-5 ফ্যামিলি, অ্যানথ্রপিকের ক্লাউড 3 এবং 4.5 মডেল এবং Google-এর জেমিনি 1.5 এবং 2.5 মডেলের সংস্করণ অন্তর্ভুক্ত ছিল।
কিভাবে অধ্যয়ন কাজ করেছে
গবেষকরা মূলত মানব অংশগ্রহণকারীদের জন্য ডিজাইন করা একটি মাল্টি-অ্যাট্রিবিউট ডিসিশন মেকিং গেমকে অভিযোজিত করেছেন। গেমটি একটি ডিজিটাল গ্রিড উপস্থাপন করে যা লুকানো পুরস্কারের ঝুড়ির প্রতিনিধিত্ব করে, যার লক্ষ্য সর্বোচ্চ পয়েন্ট মান সহ ঝুড়িটি বেছে নিয়ে চূড়ান্ত পুরস্কার সর্বাধিক করা। প্রতিটি কক্ষ খরচের পয়েন্ট প্রকাশ করে, যা অংশগ্রহণকারীদের একটি ভাল ঝুড়ি খুঁজে পাওয়ার সুবিধার বিপরীতে তথ্য সংগ্রহের খরচের ভারসাম্য বজায় রাখতে বাধ্য করে।
গবেষকরা এই ভিজ্যুয়াল গেমটিকে একটি পাঠ্য-ভিত্তিক বিন্যাসে রূপান্তর করেছেন যা ভাষা মডেলগুলি প্রক্রিয়া করতে পারে। এআই মডেলগুলি বিভিন্ন প্রম্পটিং অবস্থার অধীনে শত শত ট্রায়ালের মাধ্যমে খেলেছে। কেউ কেউ প্রাথমিক নির্দেশনা পেয়েছেন, কেউ কেউ ধাপে ধাপে যুক্তিকে উৎসাহিত করার প্রম্পট পেয়েছেন এবং অন্যদেরকে মানব গেমপ্লের অতীত উদাহরণ দেখানো হয়েছে। প্রতিটি ধরণের নাজের জন্য, গবেষকরা প্রতি মডেলে প্রায় 300 থেকে 340টি ট্রায়াল চালিয়েছেন, মোট প্রায় দুই বিলিয়ন টেক্সট টোকেন ব্যবহার করেছেন।
চার ধরনের নাজ পরীক্ষা করা হয়েছে
গবেষণাটি বাস্তব-বিশ্বের সিদ্ধান্তের পরিবেশকে অনুকরণ করার জন্য ডিজাইন করা চারটি নির্দিষ্ট ধরণের নাজ পরীক্ষা করেছে:
- ডিফল্ট নাজ: একটি ঝুড়ি আগে থেকে নির্বাচিত ছিল, এবং এজেন্টকে সক্রিয়ভাবে এটি গ্রহণ বা প্রত্যাখ্যান করতে হয়েছিল।
- পরামর্শ নাজ: একটি এলোমেলো ঝুড়ি খেলার শুরুতে বা দেরীতে সুপারিশ করা হয়েছিল।
- তথ্য হাইলাইটিং: কিছু পুরস্কারের মান প্রকাশ করার জন্য এটি সস্তা করা হয়েছে, সম্ভাব্যভাবে সাবঅপ্টিমাল পছন্দের দিকে এজেন্টকে পরিচালনা করে।
- অনুকূল নাজেস: নির্দিষ্ট কোষগুলি আগে থেকেই প্রকাশ করা হয়েছিল যা গাণিতিকভাবে একজন মানুষের খেলোয়াড়ের পারফরম্যান্সকে সর্বাধিক করে তুলবে৷
উদ্বেগজনক কমপ্লায়েন্স রেট
ফলাফলগুলি মানব এবং এআই সিদ্ধান্ত গ্রহণের আচরণের মধ্যে নাটকীয় পার্থক্য প্রকাশ করেছে।
একটি ডিফল্ট বিকল্পের সাথে উপস্থাপিত হলে, মানুষ প্রায় 88 শতাংশ সময় ডিফল্ট বেছে নেয়। ভাষার মডেলগুলি উল্লেখযোগ্যভাবে আরও সঙ্গতিপূর্ণ ছিল, বেশ কয়েকটি মডেল সময়ের 99 থেকে 100 শতাংশ ডিফল্ট বাস্কেট গ্রহণ করে।
এই প্যাটার্ন পরামর্শ nudges সঙ্গে অব্যাহত. খেলার শুরুতে 35 শতাংশ সময় মানুষ এলোমেলোভাবে প্রস্তাবিত ঝুড়ি গ্রহণ করে। অনেক এআই মডেল এই র্যান্ডম পরামর্শগুলিকে অনেক বেশি হারে গ্রহণ করে, পরামর্শ অনুসরণ করে এমনকি যখন এটি কোন যৌক্তিক সুবিধা দেয়নি।
পরামর্শের সময়ও মডেলগুলিকে অপ্রাকৃতিক উপায়ে চালিত করেছে। যদিও মানুষ দেরিতে পরামর্শগুলি 25 শতাংশ অনুসরণ করে, কিছু ভাষা মডেল তাদের গ্রহণযোগ্যতার হার 7 থেকে 13 শতাংশের মধ্যে নেমে আসে। এটি বোঝায় যে মডেলগুলি এর প্রকৃত উপযোগিতা মূল্যায়ন করার পরিবর্তে ক্যুটির সময় কঠোরভাবে প্রতিক্রিয়া জানাচ্ছিল।
সম্ভবত সবচেয়ে উদ্বেগজনকভাবে, যখন গবেষকরা তথ্য হাইলাইটিংয়ের মাধ্যমে সাবঅপ্টিমাল পছন্দগুলি হাইলাইট করেছিলেন, তখন মানুষ সেই বিভ্রান্তিকর তথ্যটি 57 শতাংশ সময় ব্যবহার করেছিল। বেশিরভাগ পরীক্ষিত AI মডেলগুলি এই বেসলাইনটিকে উল্লেখযোগ্যভাবে ওভারশট করেছে, খারাপ হাইলাইট 83 থেকে 100 শতাংশ সময় অনুসরণ করে।
ভালো স্কোরের পিছনে লুকানো সমস্যা
গবেষকরা চূড়ান্ত পছন্দ করার আগে মডেলগুলি কীভাবে তথ্য সংগ্রহ করেছে তাও ট্র্যাক করেছে। মানুষ একটি শিক্ষিত অনুমান করতে শুধুমাত্র পর্যাপ্ত কোষ প্রকাশ করতে থাকে। ভাষার মডেলগুলি অত্যন্ত অস্বাভাবিক এবং অদক্ষ উপায়ে তথ্য অর্জন করেছে।
কিছু মডেল ডেটা সংগ্রহের সুযোগকে সম্পূর্ণ উপেক্ষা করে কোনো লুকানো কোষ প্রকাশ না করেই ঝুড়ি বেছে নেয়। অন্যান্য মডেলগুলি সম্পূর্ণ সারি বা কলামগুলি প্রকাশ করার জন্য অতিরিক্ত পয়েন্ট ব্যয় করেছে, তাদের সম্ভাব্য পুরষ্কারগুলি নষ্ট করেছে। কিছু মডেল অদ্ভুত স্থানিক পক্ষপাতগুলি প্রদর্শন করে, শুধুমাত্র গ্রিডের বাম দিকে বা তির্যক রেখা বরাবর কঠোরভাবে কোষগুলিকে উন্মোচিত করে।
ধাপে ধাপে যুক্তির প্রম্পট বা মানুষের গেমপ্লের উদাহরণ সহ মডেলগুলি প্রদান করা এই অদ্ভুত অনুসন্ধানের অভ্যাসগুলিকে ঠিক করতে খুব কমই করেছে৷
লেখকরা উল্লেখ করেছেন যে শুধুমাত্র চূড়ান্ত স্কোরগুলির দিকে তাকিয়ে এই অন্তর্নিহিত সমস্যাগুলি লুকিয়ে রাখতে পারে। কিছু পরীক্ষায়, এআই মডেলগুলি মানব খেলোয়াড়দের মতো একই সংখ্যক নেট পয়েন্ট অর্জন করেছে। একটি নৈমিত্তিক পর্যবেক্ষক শুধুমাত্র চূড়ান্ত স্কোর পরীক্ষা করে অনুমান করতে পারে যে মডেলগুলি স্মার্ট, মানুষের মতো পছন্দগুলি তৈরি করছে৷ বাস্তবে, মডেলগুলি প্রায়শই কৌশলগত চিন্তাভাবনার পরিবর্তে অন্ধ সম্মতির মাধ্যমে এই স্কোরগুলি অর্জন করে।
যদি একটি ধাক্কা একটি ভাল ঝুড়ির দিকে নির্দেশ করে, অত্যধিক অনুগত AI ভাল স্কোর করেছে। যখন নাজটি একটি খারাপ ঝুড়ির দিকে নির্দেশ করে, তখন AI অন্ধভাবে এটিকে একটি নিম্ন স্কোরে অনুসরণ করে, গেমটির উদ্দেশ্য সম্পূর্ণভাবে মিস করে।
এআই এজেন্ট স্থাপনার জন্য প্রভাব
"এআই এজেন্টদের অনেক অ্যাপ্লিকেশন স্পষ্টভাবে অনুমান করে যে, অনিশ্চয়তার অধীনে, তারা মোটামুটি মানুষের মতো উপায়ে প্রতিক্রিয়া জানাবে, যদি আরও যুক্তিযুক্ত না হয়," চেরেপ বলেছিলেন। "এই ধারণাটি গ্রহণ করার পরিবর্তে, আমরা এজেন্টরা কীভাবে আচরণ করে যখন তাদের কাছে পছন্দগুলি বিভিন্ন উপায়ে উপস্থাপন করা হয় তা অন্বেষণ করার সিদ্ধান্ত নিয়েছি।"
অধ্যয়নের ফলাফলগুলি ওয়েব ব্রাউজ করতে, সরঞ্জামগুলি পরিচালনা করতে এবং ব্যবহারকারীদের জন্য আর্থিক বা কেনাকাটার সিদ্ধান্ত নেওয়ার জন্য ডিজাইন করা এআই এজেন্টদের দ্রুত বর্ধনশীল বাজারের জন্য উল্লেখযোগ্য প্রভাব ফেলেছে। যদি এই এজেন্টরা সমালোচনামূলক মূল্যায়ন ছাড়াই অন্ধভাবে ডিফল্ট বিকল্প, পরামর্শ, বা হাইলাইট করা তথ্য অনুসরণ করে, তবে তারা খারাপ অভিনেতা বা খারাপভাবে ডিজাইন করা ইন্টারফেস দ্বারা সহজেই ম্যানিপুলেট করা যেতে পারে।
গবেষণাটি পরামর্শ দেয় যে বর্তমান ভাষার মডেলগুলিতে আবদ্ধ যৌক্তিকতার অভাব রয়েছে যা মানুষের সিদ্ধান্ত গ্রহণকে গাইড করে। যদিও মানুষ একটি ভাল পছন্দ করার পুরষ্কারের বিপরীতে তথ্য সংগ্রহের খরচের ভারসাম্যের জন্য মানসিক শর্টকাট ব্যবহার করে, এআই মডেলগুলি এই জৈবিক সীমাবদ্ধতাগুলি ভাগ করে না, তবুও তারা তাদের নিজস্ব অযৌক্তিকতা প্রদর্শন করে যা যুক্তিযুক্তভাবে আরও চরম এবং কম অনুমানযোগ্য।
এআই থেকে এগিয়ে থাকুন
আরও ব্রেকিং AI খবর এবং বিশ্লেষণের জন্য, AI Buzz Wire দেখুন।
আরও এআই খবর পড়ুন →
