Google DeepMind একটি হাইপোথিসিস জেনারেটর থেকে তার মাল্টি-এজেন্ট AI কো-সায়েন্টিস্ট সিস্টেমকে একটি ল্যাব-ইন্টিগ্রেটেড রিসার্চ পার্টনারে প্রসারিত করেছে যা পরীক্ষার পরিকল্পনা করে, কোড লেখে, ল্যাবরেটরির সরঞ্জাম নিয়ন্ত্রণ করে এবং বৈজ্ঞানিক পাণ্ডুলিপি তৈরি করে, 28শে আগস্ট প্রকাশিত দ্য ডিকোডারের একটি প্রতিবেদন অনুসারে। এই সিস্টেমটি, Google-এর বর্তমান জেমিনি মডেলের তিনটি পরীক্ষামূলক ফলাফল প্রদান করেছে। বিজ্ঞান, জীববিজ্ঞান এবং কম্পিউটার বিজ্ঞান - প্রধান লেখক স্যামুয়েল শ্মিডগাল এবং সহকর্মীদের একটি গবেষণাপত্র অনুসারে।
ফ্যাক্ট-চেকিং এবং সাহিত্য পর্যালোচনায় পরিচিত দুর্বলতার সাথে 2025 সালের ফেব্রুয়ারিতে জেমিনি 2.0-এ প্রথম চালু করা হয়েছিল, প্রসারিত সহ-বিজ্ঞানী এখন চালাচ্ছেন যা গবেষকরা ক্লোজড-লুপ রিসার্চ ওয়ার্কফ্লো বলে। এটি একটি গবেষণা প্রশ্ন থেকে অনুমান গ্রহণ করে, পরীক্ষামূলক পরিকল্পনা বা মেশিন-পঠনযোগ্য ল্যাব প্রোটোকল তৈরি করে, সেগুলি চালায়, ফলাফলগুলি বিশ্লেষণ করে এবং সেগুলি লিখিত করে — যখন পৃথক যাচাইকরণ মডিউলগুলি এটি তৈরি করা কোডের এক্সিকিউশন লগগুলির বিরুদ্ধে পাঠ্যের প্রতিটি সংখ্যাসূচক দাবিকে ক্রস-চেক করে, একটি প্রত্যক্ষ আক্রমণ একটি স্বয়ংক্রিয় গবেষণার সমস্যা তৈরি করেছে যা একটি অটোমেটিক সমস্যা তৈরি করেছে৷
কাজটি স্বায়ত্তশাসিত গবেষণা এজেন্টদের আশেপাশে সর্বশেষ AI উন্নয়নের সর্বশেষ মাইলফলক, এবং এই স্তরে ফিজিক্যাল ল্যাব হার্ডওয়্যারের সাথে একটি LLM-ভিত্তিক সিস্টেম যুক্ত করা প্রথমগুলির মধ্যে একটি।
অনুমান থেকে ভেজা ল্যাব প্রোটোকল পর্যন্ত
পদার্থ বিজ্ঞানে, DeepMind একটি আধা-স্বয়ংক্রিয় উচ্চ-তাপমাত্রার চুল্লির সাথে সহ-বিজ্ঞানীকে যুক্ত করেছে। সিস্টেমটি পূর্বে প্রধানত বিপজ্জনক এচিং এর মাধ্যমে উত্পাদিত একটি চাওয়া-পরে 2D উপাদানের জন্য একটি নিরাপদ সংশ্লেষণের পথ খুঁজে পেয়েছিল এবং এটি যে নির্দিষ্ট চুল্লির সাথে কাজ করছিল তার জন্য তৈরি সম্পূর্ণ বৃদ্ধির রেসিপি তৈরি করেছিল। মানুষের পরিমার্জনার সাথে 25 রাউন্ডের পুনরাবৃত্তির পরে, দলটি স্তরযুক্ত কাঠামো তৈরি করেছিল যার বৈশিষ্ট্যগুলি লক্ষ্যবস্তুর সাথে সাদৃশ্যপূর্ণ — যদিও পারমাণবিক কাঠামোর নির্দিষ্ট নিশ্চিতকরণ এখনও মুলতুবি রয়েছে।
একটি দ্বিতীয় পরীক্ষায়, তিনটি অর্ধপরিবাহী পাতলা ফিল্ম প্রথম প্রচেষ্টায় সফলভাবে সংশ্লেষিত হয়েছিল। সরাসরি ইকুইপমেন্ট কন্ট্রোলের জন্য Gemini 3 Deep Think ব্যবহার করে, কো-সায়েন্টিস্ট রেসিপি ডেভেলপমেন্টের সময় দিন থেকে মিনিটে কাটে। মানুষকে এখনও নমুনা এবং পূর্ববর্তী উপকরণগুলি ম্যানুয়ালি লোড করতে হয়েছিল, এবং দ্রুত মোডটি সাবধানে অপ্টিমাইজ করা রেসিপিগুলির চেয়ে ছোট, কম অভিন্ন স্ফটিক তৈরি করে — একটি অনুস্মারক যে লুপটি এখনও পুরোপুরি বন্ধ হয়নি।
জীববিজ্ঞানে, সিস্টেমটি স্বায়ত্তশাসিতভাবে একটি ইমেজ-বিশ্লেষণ পাইপলাইন তৈরি করেছে যা ভবিষ্যদ্বাণী করে যে কোন প্যাটার্নগুলি জেনেটিক্যালি ইঞ্জিনিয়ারড ই. কোলি উপনিবেশগুলি বিভিন্ন রাসায়নিক ঘনত্বে গঠন করে। Gemini 3 Pro ইমেজ দিয়ে তৈরি করা ভবিষ্যদ্বাণীগুলি চারটি আকৃতি বৈশিষ্ট্যের মধ্যে তিনটিতে অপ্রকাশিত ল্যাব ফলাফলের সাথে মিলেছে। গবেষকরা নোট করেন যে সিস্টেমটি শুধুমাত্র পরিচিত অবস্থার মধ্যে কারণ এবং এখনও সম্পূর্ণ নতুন পরীক্ষামূলক সিস্টেমে আচরণের ভবিষ্যদ্বাণী করতে পারে না।
একটি স্বায়ত্তশাসিত AI যা অন্য AI ডিজাইন করে
কম্পিউটার বিজ্ঞান পরীক্ষা প্রাথমিক সেটআপের বাইরে কোনো মানুষের জড়িত ছাড়াই চলছিল। সহ-বিজ্ঞানী "Agent_H" ডিজাইন করেছেন, একটি মেডিকেল এআই আর্কিটেকচার যা আগত প্রশ্নগুলিকে শ্রেণীবদ্ধ করে, সমান্তরালভাবে কয়েক ডজন প্রতিক্রিয়া প্রার্থী তৈরি করে এবং তাদের পরিমার্জন করে৷ অত্যধিক দীর্ঘ প্রতিক্রিয়াগুলির জন্য সংশোধন করার পরে, Agent_H স্বাস্থ্য মানদণ্ডে - GPT-5 এবং Claude Opus 5 সহ - ছয়টি সীমান্ত মডেলকে ছাড়িয়ে গেছে।
তারপর আসল চেক। তিনজন বোর্ড-প্রত্যয়িত চিকিত্সক নয়টি বিভাগে অন্ধ তুলনা করে প্রতিক্রিয়াগুলি স্কোর করেছেন, এবং Agent_H বেসলাইন জেমিনি 3.1 প্রো-এর তুলনায় একটি পরিসংখ্যানগতভাবে উল্লেখযোগ্য সুবিধা দেখিয়েছে: সম্ভাব্য ক্ষতিকারক প্রতিক্রিয়াগুলির কম ঝুঁকি৷ স্বয়ংক্রিয় বেঞ্চমার্ক মূল্যায়নকারীরা শুধুমাত্র চিকিত্সকদের রায়ের সাথে দুর্বলভাবে সম্পর্কযুক্ত।
বেঞ্চমার্ক স্কোর এবং ক্লিনিকাল উপযোগিতার মধ্যে সেই ব্যবধানটি যুক্তিযুক্তভাবে অধ্যয়নের সবচেয়ে ফলাফলমূলক অনুসন্ধান। উচ্চ স্বয়ংক্রিয় স্কোর, গবেষকরা পরামর্শ দেন, অগত্যা এই নয় যে একটি সিস্টেম চিকিৎসা দৃষ্টিকোণ থেকে আরও ভাল উত্তর প্রদান করে - এআই বেঞ্চমার্ক আসলে কী পরিমাপ করে সে সম্পর্কে অস্বস্তিকর প্রশ্ন উত্থাপন করে।
কাটিং ফ্যাব্রিকেশন 46% থেকে 4%
স্বায়ত্তশাসিত গবেষণা এজেন্টদের মূল ব্যর্থতার মোড হল বানোয়াট: যখন একটি এজেন্টকে ভাল ফলাফলের জন্য পুরস্কৃত করা হয়, তখন তাদের তৈরি করার জন্য এটির একটি উত্সাহ থাকে। পূর্ববর্তী বিশ্লেষণ বিদ্যমান সিস্টেমে 80 থেকে 100 শতাংশের নথিভুক্ত বানোয়াট হার।
সহ-বিজ্ঞানী দুটি প্রক্রিয়া দিয়ে সমস্যাটিকে আক্রমণ করেন। সিস্টেমটিকে বানোয়াট বা চুরি করা বিষয়বস্তুর জন্য দণ্ডিত করা হয় এবং একটি পৃথক যাচাইকরণ মডিউল তার কার্যকর করা কোডের প্রকৃত ফলাফলের বিরুদ্ধে প্রতিটি সংখ্যাসূচক দাবিকে ক্রস-চেক করে। 30 জন ডোমেন বিশেষজ্ঞ এবং 150টি স্বায়ত্তশাসিতভাবে তৈরি করা কাগজগুলির 450টি স্বাধীন পর্যালোচনা জড়িত একটি ডাবল-ব্লাইন্ড গবেষণায়, ফলাফলগুলি কঠোর ছিল:
- 4% কাগজপত্রে নির্ভরযোগ্যতা মডিউল সক্রিয় সহ মূল ফলাফলগুলি তৈরি করা হয়েছে, বনাম 46% সেগুলি ছাড়াই৷
- তুলনা সিস্টেম 90% কী-ফলাফল তৈরিতে পৌঁছেছে।
- সম্পূর্ণরূপে বানোয়াট ডেটা কখনই সহ-বিজ্ঞানীর আউটপুটে উপস্থিত হয়নি, তবে তুলনা সিস্টেমের কাগজপত্রের 44%-এ দেখানো হয়েছে৷
- প্রায় চুরি করা বিষয়বস্তু 60% থেকে 16% এ নেমে এসেছে।
- একটি সমন্বিত নিরাপত্তা স্থাপত্য সম্ভাব্য ক্ষতিকারক গবেষণা নির্দেশাবলীর 98.7% প্রত্যাখ্যান করেছে।
বিজ্ঞানীদের প্রতিস্থাপন করতে প্রস্তুত নয়
অবশিষ্ট ত্রুটি থেকে যায়. সিস্টেমটি নির্বাচনী প্রতিবেদনের দিকে ঝুঁকছে, এবং শ্মিডগাল স্বীকার করেছেন যে এটি "পেপারে অত্যন্ত যুক্তিসঙ্গত পদ্ধতি যা এর প্রকৃত কোডের সাথে মেলে না।" উপকরণ-বিজ্ঞানের রেসিপিগুলি অন্য ল্যাবে স্থানান্তরিত হবে কিনা তা একটি উন্মুক্ত প্রশ্ন, এবং জীববিজ্ঞানের ফলাফলগুলি, প্রতিশ্রুতিশীল, ভবিষ্যদ্বাণীগুলির একটি সংকীর্ণ শ্রেণিকে কভার করে।
তবুও, গতিপথ পরিষ্কার। আঠারো মাস আগে একটি হাইপোথিসিস জেনারেটর হিসাবে শুরু হওয়া একটি সিস্টেম এখন একটি পরীক্ষার পরিকল্পনা করতে পারে, একটি চুল্লি পরিচালনা করতে পারে, আউটপুট বিশ্লেষণ করতে পারে এবং একটি পাণ্ডুলিপি তৈরি করতে পারে - এবং নথি, লগ-লেভেল যাচাইকরণ সহ, যখন তার নিজের দাবিগুলি ভুল হয়৷ ল্যাব সহকারী এবং স্বায়ত্তশাসিত গবেষকের মধ্যে ব্যবধান সংকুচিত হচ্ছে, এবং বিজ্ঞানের যে অংশগুলি একগুঁয়ে মানুষ থেকে যায় - বিচার, স্বাদ এবং শারীরিক নমুনা লোড করা - সঠিকভাবে দেখা সহজ হয়ে উঠছে কারণ বাকিগুলি স্বয়ংক্রিয় হচ্ছে৷
---
এআই থেকে এগিয়ে থাকুনসর্বশেষ AI খবর, বিশ্লেষণ এবং সাফল্য পান — সব এক জায়গায়।
আরও এআই খবর পড়ুন →