মঙ্গলবার নেচার কমিউনিকেশনস-এ প্রকাশিত MIT কম্পিউটার বিজ্ঞানীদের একটি নতুন গবেষণায় এমন একটি ফলাফল পাওয়া যায় যা এআই কপিরাইট নিয়ে বিতর্ককে নতুন আকার দিতে পারে: যেহেতু ডিফিউশন মডেলগুলিকে আরও ডেটাতে প্রশিক্ষিত করা হয়, তাদের আউটপুটগুলি প্রশিক্ষণের কোনও নির্দিষ্ট অংশে ফিরে আসা ক্রমবর্ধমানভাবে অসম্ভব হয়ে ওঠে। গবেষকরা ঘটনাটিকে "অ্যাট্রিবিউশন ক্ষয়" বলেছেন। জেনারেটিভ AI-এর দ্রুত-চলমান বিশ্বকে ট্র্যাক করা পাঠকদের জন্য, এই সপ্তাহে AI Buzz Wire দ্বারা কভার করা গবেষণার ফলাফলগুলির মধ্যে একটি পেপার।

"জেনারেটিভ ডিফিউশন মডেলের আউটপুটগুলি প্রায়শই অনুপযোগী" শিরোনামের গবেষণাপত্রটি জেং দাই এবং ডেভিড কে. গিফোর্ড দ্বারা রচিত হয়েছিল, উভয়ই এমআইটির কম্পিউটার বিজ্ঞান এবং কৃত্রিম বুদ্ধিমত্তা ল্যাবরেটরি (সিএসএআইএল) এর সাথে অনুমোদিত। তাদের কেন্দ্রীয় প্রশ্নটি প্রতারণামূলকভাবে সহজ ছিল: যখন একটি জেনারেটিভ মডেল একটি চিত্র তৈরি করে, তখন আপনি কি সেই আউটপুটের জন্য দায়ী প্রশিক্ষণের ডেটাতে একটি নির্দিষ্ট আইটেম সনাক্ত করতে পারেন?

যা পেয়েছেন গবেষকরা

উত্তর, ক্রমবর্ধমান, না. গবেষকরা দেখান যে অ্যাট্রিবিউশন - প্রশিক্ষণের ডেটার অংশ সনাক্ত করার কাজ হিসাবে সংজ্ঞায়িত যা একটি উত্পন্ন নমুনার জন্য দায়ী হতে পারে - "অসম্ভব হতে পারে যদি একটি মডেলকে যথেষ্ট পরিমাণে ডেটার উপর প্রশিক্ষণ দেওয়া হয়।"

"আমরা দেখতে পাই যে একটি মডেলকে যত বেশি ডেটা প্রশিক্ষিত করা হয়, তার উৎপন্ন নমুনাগুলি তত কম অ্যাট্রিবিউটযোগ্য হয়ে ওঠে, এমন একটি ঘটনা যা আমরা এখন থেকে অ্যাট্রিবিউশন ক্ষয় হিসাবে উল্লেখ করি," লেখক লিখেছেন৷

এটি পরীক্ষা করার জন্য, দলটি একটি "অ্যাবলেশন" পদ্ধতি তৈরি করেছে যা ব্যয়বহুল পুনঃপ্রশিক্ষণ ছাড়াই নির্দিষ্ট প্রশিক্ষণের উদাহরণগুলিকে ইতিমধ্যে-প্রশিক্ষিত মডেল থেকে সরিয়ে ফেলার অনুমতি দেয়। তারপরে তারা বৃহৎ পরিসরে কি-যদি পরীক্ষা-নিরীক্ষা চালায়: মডেলটি কী তৈরি করবে যদি একটি নির্দিষ্ট চিত্র, বা একটি সম্পূর্ণ সৃষ্টিকর্তার কাজ, প্রশিক্ষণ সেটে কখনও না থাকত?

গবেষণার সবচেয়ে আকর্ষণীয় ফলাফলের মধ্যে, গবেষকরা দেখেছেন যে পর্যাপ্ত বড় ডেটাসেটে প্রশিক্ষিত মডেলগুলির জন্য, তারা মোনা লিসা - এমনকি লিওনার্দো দা ভিঞ্চির সমস্ত কাজও সরিয়ে ফেলতে পারে - এবং মডেলটি এখনও চিত্র বা শৈল্পিক শৈলী পুনরুত্পাদন করতে পারে। কোনো একক প্রশিক্ষণ আইটেম আউটপুট জন্য কার্যত দায়ী ছিল.

কেন এটি কপিরাইট মামলার জন্য গুরুত্বপূর্ণ

অনুসন্ধানগুলি একটি সক্রিয় আইনি যুদ্ধক্ষেত্রের মাঝখানে অবতরণ করে। মিডজার্নি এবং স্টেবল ডিফিউশনের মতো ডিফিউশন মডেলগুলি শিল্পীদের কাছ থেকে মামলাগুলি আকৃষ্ট করেছে যারা যুক্তি দেয় যে প্রশিক্ষণ ডেটাতে তাদের কাজের অনুলিপি AI সিস্টেমগুলিকে তাদের আউটপুট এবং শৈলী পুনরুত্পাদন করতে দেয়।

2023 থেকে একটি চলমান কপিরাইট মামলায়, অ্যান্ডারসন এট আল। v. স্টেবিলিটি এআই লিমিটেড, বাদীরা মিডজার্নিকে তার মডেলগুলিকে প্রশিক্ষণের জন্য ব্যবহৃত ডেটাসেটগুলি প্রকাশ করতে বাধ্য করার চেষ্টা করছে৷ তারা অভিযোগ করে যে মিডজার্নি তার প্রশিক্ষণ সেটগুলি "নির্দিষ্ট শিল্পীদের নামের সাথে যুক্ত চিত্রগুলিকে স্ক্র্যাপ করে সেই শিল্পীদের অভিব্যক্তিপূর্ণ বিষয়বস্তুকে অনুকরণ করতে এর মডেলকে সক্ষম করার জন্য" তৈরি করেছে৷

এমআইটি অধ্যয়ন পরামর্শ দেয় যে এই ধরনের কার্যকারণ লিঙ্ক স্থাপন করা প্রযুক্তিগতভাবে স্কেলে অসম্ভব হতে পারে। দ্য রেজিস্টার, যা প্রথম অধ্যয়নের বিশদ প্রতিবেদন করেছিল, উল্লেখ করেছে, গবেষণাটি এআই নিয়ন্ত্রণকে সহজের পরিবর্তে আরও কঠিন করে তুলবে বলে মনে হচ্ছে - লেখকরা যখন কাজ শুরু করেছিলেন তখন তারা যা আশা করেছিলেন তার বিপরীত।

ন্যায্য ব্যবহারের প্রশ্ন

এমআইটি-এর প্রেস রিলিজে, গিফোর্ড যুক্তি দিয়েছেন যে ফলাফলগুলি উভয় উপায়ে কাটা হয়েছে। যদি উত্পন্ন আউটপুটগুলির প্রশিক্ষণ ডেটার কোনও পৃথক অংশের সাথে কোনও সম্পর্ক না থাকে তবে মডেলগুলি নিছক অনুলিপি মেশিনের পরিবর্তে সত্যিকারের সৃজনশীল হতে পারে।

"এটি ন্যায্য ব্যবহার সম্পর্কে প্রশ্ন উত্থাপন করে, উপন্যাসের কাজ হিসাবে আউটপুটগুলি নিজেরাই কপিরাইটযোগ্য কিনা এবং কোনও মডেল থেকে যা বেরিয়ে আসে তা ইন্টারনেটে কোনও কিছুর জন্য দায়ী না হলে লেখকরা কীভাবে ক্ষতিপূরণ পান সে সম্পর্কে," গিফোর্ড বলেছিলেন।

প্রভাব ইমেজ জেনারেটর অতিক্রম প্রসারিত. ডিফিউশন মডেলগুলি অডিওভিজ্যুয়াল মিডিয়া তৈরির জন্য প্রভাবশালী আর্কিটেকচারে পরিণত হয়েছে এবং প্রোটিন কাঠামো মডেলিং এবং থেরাপিউটিক আবিষ্কার সহ বৈজ্ঞানিক অ্যাপ্লিকেশনগুলিতে ক্রমবর্ধমানভাবে ব্যবহৃত হচ্ছে। মেশিন আনলার্নিং, ডেটা পয়জনিং ডিটেকশন, মডেল ব্যাখ্যাযোগ্যতা, ন্যায্যতা নিরীক্ষা এবং গোপনীয়তা সম্মতির জন্য অ্যাট্রিবিউশন সরঞ্জামগুলিও প্রস্তাব করা হয়েছে।

অ্যাট্রিবিউশন স্টার্টআপের জন্য একটি সতর্কতা

গবেষণাটি এআই প্রোভেনেন্স এবং বিষয়বস্তু-যাচাই সরঞ্জামগুলির ক্রমবর্ধমান শিল্পের জন্য একটি সতর্কতাও বহন করে। গবেষকরা দেখেছেন যে সাদৃশ্য-ভিত্তিক অ্যাট্রিবিউশন - দৃশ্যত অনুরূপ প্রশিক্ষণ চিত্রগুলির সাথে উত্পন্ন আউটপুট মিলে - বৃহৎ প্রশিক্ষণ ডেটা ব্যবস্থায় মিথ্যা বৈশিষ্ট্য তৈরি করে।

অন্য কথায়, একটি টুল যা দাবি করে যে "এই AI চিত্রটি সেই শিল্পীর পোর্টফোলিও থেকে এসেছে" তা কেবল ভুল হতে পারে যখন মডেলগুলিকে কোটি কোটি ছবিতে প্রশিক্ষণ দেওয়া হয়। প্ল্যাটফর্ম, আদালত, এবং নিয়ন্ত্রকদের জন্য প্রাধান্য বিরোধ নিষ্পত্তির জন্য প্রযুক্তিগত বৈশিষ্ট্যের উপর নির্ভর করে, এমআইটি ফলাফলগুলি নির্দেশ করে যে এই ধরনের নিশ্চিততা সীমান্ত-স্কেল মডেলগুলির জন্য নাগালের বাইরে হতে পারে।

এরপর কি আসে

ইইউ এআই অ্যাক্টের স্বচ্ছতার প্রয়োজনীয়তা এবং শিল্পীর ক্ষতিপূরণ ব্যবস্থার প্রস্তাবনাগুলি নিয়ে আলোচনা সহ চলমান মামলা এবং নীতি বিতর্কে কাগজটি উদ্ধৃত করা হবে বলে আশা করা হচ্ছে। যদি অ্যাট্রিবিউশন ক্ষয় সবচেয়ে বড় উত্পাদন মডেলের জন্য থাকে, তবে নির্দিষ্ট কাজের জন্য আউটপুট ট্রেসিং এর উপর ভিত্তি করে ক্ষতিপূরণ স্কিমগুলি আইটেম-স্তরের ট্র্যাকিংয়ের পরিবর্তে যৌথ লাইসেন্সিং এর চারপাশে পুনরায় ডিজাইন করা প্রয়োজন হতে পারে।

অধ্যয়নটি এআই বিকাশকারীদের জন্য একটি সূক্ষ্ম বিষয়ও উত্থাপন করে: অনুপযুক্ততা প্রকৃতপক্ষে কপিরাইটযুক্ত ডেটার প্রশিক্ষণের জন্য ন্যায্য ব্যবহারের যুক্তিগুলিকে শক্তিশালী করতে পারে, একই সাথে পৃথক আউটপুট থেকে নির্দিষ্ট ক্ষতি প্রমাণ করার জন্য শিল্পীদের ক্ষমতাকে হ্রাস করতে পারে। কপিরাইট লড়াইয়ের উভয় পক্ষই ডেটা ব্যবহার করার জন্য কিছু খুঁজে পাবে।

এআই থেকে এগিয়ে থাকুন

আরও ব্রেকিং AI গবেষণা এবং বিশ্লেষণের জন্য, AI শিল্পের দৈনিক কভারেজের জন্য AI Buzz Wire দেখুন।

আরও এআই খবর পড়ুন →