Google DeepMind কম্পিউটারের ব্যবহারকে Gemini 3.5 Flash-এর মধ্যে একটি বিল্ট-ইন টুলে পরিণত করেছে, যা ডেভেলপারদের AI এজেন্ট তৈরি করার একটি নেটিভ উপায় দেয় যা থার্ড-পার্টি ফ্রেমওয়ার্কগুলিতে বোল্ট না করেই প্ল্যাটফর্ম জুড়ে সফ্টওয়্যারের সাথে যোগাযোগ করতে পারে।

24 জুন, 2026-এ Google-এর অফিসিয়াল কীওয়ার্ড ব্লগে প্রকাশিত ঘোষণাটি, জেমিনি 3.5 ফ্ল্যাশকে দ্রুত-চলমান বাজারে একটি প্রতিযোগী হিসাবে অবস্থান করে যারা এজেন্টদের জন্য একটি স্ক্রীন দেখতে, একটি কার্সার সরাতে, ক্লিক করতে এবং টাইপ করতে পারে — এমন ক্ষমতা যা সম্প্রতি পর্যন্ত উল্লেখযোগ্য কাস্টম ইঞ্জিনিয়ারিংয়ের প্রয়োজন ছিল৷ For more context on this story, see our ongoing AI news.

"কম্পিউটার ব্যবহার এখন জেমিনি 3.5 ফ্ল্যাশে একটি অন্তর্নির্মিত টুল যা এজেন্ট তৈরি করতে পারে যা প্ল্যাটফর্ম জুড়ে যোগাযোগ করতে পারে," কোম্পানি লিখেছে। পোস্টটি লিখেছেন মাতেও কুইরোস, গুগল ডিপমাইন্ডের একজন পণ্য ব্যবস্থাপক।

এটা কিভাবে কাজ করে

কম্পিউটার ব্যবহার একটি মডেলকে একজন মানুষের মতো কম্পিউটার পরিচালনা করতে দেয়: স্ক্রিনে যা আছে তা ব্যাখ্যা করে এবং ক্লিক করা, স্ক্রলিং করা এবং পাঠ্য প্রবেশ করার মতো পদক্ষেপ নেওয়ার মাধ্যমে। এটিকে একটি পৃথক পণ্য হিসাবে অফার না করে সরাসরি জেমিনি 3.5 ফ্ল্যাশে সক্ষমতা বেক করার মাধ্যমে, Google বিকাশকারীদের জন্য বাধা কমিয়ে দিচ্ছে যারা প্রকৃত অ্যাপ্লিকেশন, ওয়েবসাইট এবং অপারেটিং সিস্টেম নেভিগেট করে এমন এজেন্ট তৈরি করতে চায়৷

ব্লগ পোস্ট অনুসারে, ডেভেলপার এবং এন্টারপ্রাইজগুলি 3.5 ফ্ল্যাশের মাধ্যমে কম্পিউটার ব্যবহার শুরু করতে পারে Gemini API এবং Gemini Enterprise Agent Platform, Google-এর ডেডিকেটেড পরিবেশে এজেন্ট তৈরি এবং স্থাপনের জন্য।

Google কংক্রিট ব্যবহারের ক্ষেত্রে সক্ষমতা প্রদর্শন করেছে। একটি উদাহরণে, Gemini 3.5 Flash কম্পিউটার ব্যবহার করে Gemini অ্যাপটি নিজেই বিশ্লেষণ করতে এবং বৈশিষ্ট্যগুলির একটি শ্রেণীবদ্ধ তালিকা প্রদান করে। অন্যটিতে, মডেলটি অ্যাক্সেসিবিলিটি সমস্যাগুলির জন্য নিজস্ব ডকুমেন্টেশন অডিট করেছে - একটি স্ব-রেফারেন্সিয়াল টাস্ক যা নির্দেশ করে যে কীভাবে কম্পিউটার-ব্যবহারকারী এজেন্টরা তাদের চালানো সফ্টওয়্যার ইকোসিস্টেমগুলিকে বজায় রাখতে সাহায্য করতে পারে৷

নিরাপত্তা: প্রতিপক্ষের প্রশিক্ষণ এবং একটি 'প্রতিরক্ষা-গভীরতা' পদ্ধতি

রিলিজের সবচেয়ে ফলপ্রসূ অংশ হতে পারে গুগল নিরাপত্তা সম্পর্কে যা বলেছে। লাইভ এনভায়রনমেন্টে কাজ করে এমন এজেন্টরা প্রম্পট ইনজেকশনের জন্য স্বতন্ত্রভাবে ঝুঁকিপূর্ণ - এমন আক্রমণ যেখানে একটি ওয়েবপেজ, ইমেল বা নথিতে এম্বেড করা লুকানো নির্দেশাবলী এজেন্টকে অনিচ্ছাকৃত পদক্ষেপ নেওয়ার জন্য হাইজ্যাক করে।

গুগল বলেছে যে তারা সেই ঝুঁকিগুলি কমাতে জেমিনি 3.5 ফ্ল্যাশে কম্পিউটার ব্যবহারের জন্য লক্ষ্যযুক্ত প্রতিপক্ষ প্রশিক্ষণ ব্যবহার করেছে। এটি দুটি ঐচ্ছিক এন্টারপ্রাইজ সুরক্ষা ব্যবস্থাও প্রকাশ করছে যা সংস্থা বলেছে যে সংস্থাগুলিকে তাদের এজেন্টরা কী করতে পারে তা আরও ভালভাবে নিয়ন্ত্রণ করতে সক্ষম করে।

একটি "প্রতিরক্ষা-গভীরতা" পদ্ধতি গ্রহণ করে, Google বিকাশকারীদের নিরাপদ স্যান্ডবক্সিং, হিউম্যান-ইন-দ্য-লুপ যাচাইকরণ এবং কঠোর অ্যাক্সেস নিয়ন্ত্রণের সাথে এই বৈশিষ্ট্যগুলিকে একত্রিত করতে উত্সাহিত করেছে৷ সংস্থাটি বৈশিষ্ট্যটির জন্য তার সেরা অনুশীলন ডকুমেন্টেশনে অতিরিক্ত নির্দেশিকা প্রকাশ করেছে।

যে ফ্রেমিং ব্যাপার. কম্পিউটার ব্যবহারকে ব্যাপকভাবে মোতায়েন করার জন্য সবচেয়ে বিপজ্জনক এজেন্ট ক্ষমতাগুলির মধ্যে একটি হিসাবে দেখা হয়, কারণ একটি আপসকারী এজেন্ট ব্যবহারকারীর অ্যাকাউন্ট এবং সিস্টেমের মধ্যে বাস্তব-বিশ্বের পদক্ষেপ নিতে পারে। প্রতিকূল প্রশিক্ষণ এবং স্তরযুক্ত সুরক্ষার সাথে নেতৃত্ব দিয়ে, Google এন্টারপ্রাইজ ক্রেতাদের আশ্বস্ত করার চেষ্টা করছে যারা একটি AI-এর কাছে কার্সার নিয়ন্ত্রণ করতে দ্বিধাগ্রস্ত ছিল।

কেন কম্পিউটার ব্যবহার যুদ্ধক্ষেত্রে পরিণত হচ্ছে

জেমিনি 3.5 ফ্ল্যাশের কম্পিউটার ব্যবহার এজেন্ট তৈরির জন্য প্রধান AI ল্যাব রেস হিসাবে আসে যা কেবল প্রশ্নের উত্তর না দিয়ে দরকারী কাজ করতে পারে। অ্যানথ্রপিক 2024 সালের শেষের দিকে ক্লডের জন্য একটি কম্পিউটার ব্যবহারের টুল চালু করেছিল এবং OpenAI-এর অপারেটর এবং এজেন্ট পণ্যগুলি একই দিকে ঠেলে দিয়েছে। ফ্ল্যাশ-এর ​​মতো একটি দ্রুত, সাশ্রয়ী মডেলের ক্ষমতাকে নেটিভ করা — এটিকে প্রিমিয়াম স্তরের জন্য সংরক্ষণ না করে — ইঙ্গিত দেয় যে Google দ্রুত এজেন্ট নিয়ন্ত্রণকে কমোডিটাইজ করতে চায়৷

ফ্ল্যাশের পছন্দ নিজেই উল্লেখযোগ্য। ফ্ল্যাশ হল Google এর দক্ষতা-স্তরের মডেল, গতি এবং খরচের জন্য অপ্টিমাইজ করা হয়েছে৷ শুধুমাত্র বৃহত্তর প্রো মডেলের পরিবর্তে সেখানে কম্পিউটার ব্যবহার এম্বেড করা পরামর্শ দেয় যে Google উচ্চ-ভলিউম, লেটেন্সি-সংবেদনশীল এজেন্ট ওয়ার্কলোড আশা করে — যে ধরনের ব্যবসায়িক সফ্টওয়্যার জুড়ে পুনরাবৃত্তিমূলক কাজগুলিকে স্কেলে স্বয়ংক্রিয় করে।

গুগল বলেছে যে এটি ইতিমধ্যেই কম্পিউটার ব্যবহারের সাথে গ্রাহকদের ড্রাইভ মান দেখছে, যদিও ব্লগ পোস্টে নির্দিষ্ট বাণিজ্যিক স্থাপনার নাম বা ফলাফলের পরিমাণ নির্ধারণ করা হয়নি।

প্রতিযোগিতামূলক স্টেক

বিকাশকারীদের জন্য, একটি অন্তর্নির্মিত কম্পিউটার-ব্যবহার সরঞ্জামের আবেদনটি সহজবোধ্য: বজায় রাখার জন্য কম সংহতকরণ এবং মডেল এবং এজেন্টিক স্তর উভয়ের জন্যই দায়বদ্ধ একটি একক বিক্রেতা৷ কিন্তু এটি Google-এর প্ল্যাটফর্মের উপর নির্ভরতা আরও গভীর করে, একটি ট্রেডঅফ যা এন্টারপ্রাইজগুলি মডেল-অজ্ঞেয়বাদী এজেন্ট ফ্রেমওয়ার্কের নমনীয়তার বিরুদ্ধে ওজন করবে।

রিলিজ এজেন্ট অর্থনীতিতে একটি বিস্তৃত উত্তেজনা তীক্ষ্ণ করে। স্বাধীনভাবে বিকশিত ওপেন-সোর্স এজেন্ট গেটওয়ে, যেমন লাইটপোর্ট ফ্রেমওয়ার্ক যা একাধিক LLM প্রদানকারীকে OpenAI- সামঞ্জস্যপূর্ণ করে তোলে, দেখায় যে পোর্টেবল এজেন্ট পরিকাঠামোর জন্য কতটা চাহিদা বিদ্যমান। Google-এর বাজি হল যে একটি প্রথম-পক্ষ, নিরাপত্তা-কঠোর কম্পিউটার-ব্যবহার টুল ডেভেলপারদের উপর জয়ী হবে যারা অন্যথায় তৃতীয়-পক্ষের সরঞ্জামগুলিকে একত্রিত করবে। মডেলগুলি যখন স্ক্রিনে কাজ করার ক্ষমতা অর্জন করে, একজন এআই সহকারী এবং একটি স্বায়ত্তশাসিত অপারেটরের মধ্যে লাইনটি অস্পষ্ট হতে থাকে - এবং একইভাবে একটি উত্পাদনশীলতা অগ্রগতি এবং একটি সুরক্ষা দায়বদ্ধতার মধ্যে লাইনটিও থাকে৷ সেই উত্তেজনার জন্য গুগলের উত্তর হল স্তরপূর্ণ সুরক্ষা এবং প্রতিপক্ষ প্রশিক্ষণ। এটি ঝুঁকি-প্রতিরোধী উদ্যোগগুলিকে সন্তুষ্ট করার জন্য যথেষ্ট কিনা তা নির্ধারণ করবে কত দ্রুত কম্পিউটার-ব্যবহারকারী এজেন্টরা ডেমো থেকে দৈনন্দিন ব্যবহারের দিকে চলে যায়।

Gemini 3.5 Flash-এর সাথে, Google একটি স্পষ্ট বাজি ধরেছে: AI-এর ভবিষ্যৎ শুধুমাত্র উত্তর দেয় এমন মডেল নয়, কিন্তু যে মডেলগুলি কাজ করে — এবং এটি বিকাশকারীরা তার প্ল্যাটফর্মে সেই অভিনয় মডেলগুলি তৈরি করতে চায়৷

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →