Google এম্বেডিংগেমা 2 চালু করেছে, একটি উন্মুক্ত, লাইটওয়েট এম্বেডিং মডেল যা নেটিভভাবে একটি একক ইউনিফাইড এম্বেডিং স্পেসে পাঠ্য, ছবি, অডিও এবং ভিডিওর সমন্বয়কে ম্যাপ করে। 6 অক্টোবর, 2026-এ Google DeepMind গবেষণা প্রকৌশলী সাহিল দুয়া এবং Henrique Schechter Vera দ্বারা পোস্ট করা ঘোষণাটি, 740-মিলিয়ন-প্যারামিটার মডেলটিকে অন-ডিভাইস মাল্টিমডাল এম্বেডিংয়ের জন্য সবচেয়ে সক্ষম বিকল্প হিসেবে অবস্থান করে, যা বাণিজ্যিকভাবে অনুমোদনযোগ্য Apache 2.0 লাইসেন্সের অধীনে প্রকাশিত এবং Garchitem4-এর উপর নির্মিত।

প্রথম EmbeddingGemma Google-এর প্রত্যাশাকে ছাড়িয়ে গেছে, 20 মিলিয়নেরও বেশি ডাউনলোড অন-ডিভাইস অনুসন্ধান সরঞ্জাম এবং গোপনীয়তা-প্রথম পুনরুদ্ধার বর্ধিত প্রজন্মের পাইপলাইনগুলিকে শক্তিশালী করে৷ সিক্যুয়েলটি অবিলম্বে বিকাশকারীর আগ্রহ তৈরি করেছিল, দিনের সবচেয়ে বড় হ্যাকার নিউজ আলোচনার একটি আঁকিয়েছিল কারণ নির্মাতারা স্থানীয় AI নিউজ অ্যাপ, মিডিয়া লাইব্রেরি, এবং RAG সিস্টেমগুলির জন্য যা ক্লাউড স্পর্শ করে না তার জন্য একটি একক মাল্টিমোডাল এম্বেডারের অর্থ কী তা মূল্যায়ন করেছিল৷

পাঠ্য, কোড, চিত্র, অডিও এবং ভিডিওর জন্য একটি মডেল

EmbeddingGemma 2 এর শিরোনাম ক্ষমতা স্থানীয় মাল্টিমোডালিটি। মডেলটি প্রতি আলাদা এনকোডার চালানো এবং ফলাফলগুলি একসাথে সেলাই করার পরিবর্তে, মডেলটি একটি ভাগ করা জায়গায় পাঠ্য, কোড, চিত্র, ভিডিও এবং অডিওর সমন্বয়কে এম্বেড করে। Google-এর উদাহরণগুলির মধ্যে রয়েছে ক্যোয়ারী হিসাবে একটি ভয়েস মেমো ব্যবহার করে একটি নির্দিষ্ট ভিডিও ক্লিপ খুঁজে পাওয়া, অথবা একটি পাঠ্য প্রম্পট সহ ঘন্টার অডিও রেকর্ডিং অনুসন্ধান করা, যা স্থানীয় হার্ডওয়্যারের একটি একক মডেল দ্বারা প্রক্রিয়া করা হয়।

স্থাপত্যটি মডুলার। টেক্সট-অনলি কোরের জন্য 270 মিলিয়ন প্যারামিটারের প্রয়োজন হয়, যার মধ্যে ঐচ্ছিক দৃষ্টি (170 মিলিয়ন প্যারামিটার) এবং অডিও (300 মিলিয়ন প্যারামিটার) এনকোডার সম্পূর্ণ মাল্টিমডাল সমর্থন যোগ করে। তাই বিকাশকারীরা আজ একটি কমপ্যাক্ট টেক্সট এমবেডার স্থাপন করতে পারে এবং মডেল পরিবার পরিবর্তন না করেই সম্পূর্ণ মাল্টিমডাল পুনরুদ্ধারে পরিণত হতে পারে।

বেঞ্চমার্ক ফলাফল এবং স্টোরেজ দক্ষতা

Google রিপোর্ট করে যে এমবেডিংগেমমা 2 বেঞ্চমার্কে সাব-1বি মাল্টিমোডাল এম্বেডারের মধ্যে শীর্ষস্থানীয় স্কোর অর্জন করেছে, যার মধ্যে রয়েছে MTEB (ম্যাসিভ টেক্সট এম্বেডিং বেঞ্চমার্ক) কোড এবং MAEB (ম্যাসিভ অডিও এম্বেডিং বেঞ্চমার্ক), যেখানে টেক্সট, ভিশন এবং অডিও টাস্ক জুড়ে অনেক বড় মডেলের সাথে মিলে যায় বা ছাড়িয়ে যায়। সবচেয়ে সুনির্দিষ্ট লাভ হল কোডে: MTEB কোড কর্মক্ষমতা 9.92 পয়েন্ট লাফিয়ে 68.76 থেকে 78.68 এ, যা Google বলে যে মডেলটিকে স্থানীয় কোডবেস ইনডেক্সিং, শব্দার্থিক কোড অনুসন্ধান এবং কোডিং এজেন্ট পুনরুদ্ধারের জন্য উপযুক্ত করে তোলে। ইমেজ, ভিডিও, নথি এবং অডিও জুড়ে, কোম্পানি সাব-1B মডেলের জন্য গুণমান-প্রতি-প্যারামিটারে একটি নতুন মান দাবি করে, বলে যে এটি কিছু বিশেষজ্ঞ মডেলকে তার আকারের দ্বিগুণেরও বেশি পারফর্ম করে।

স্টোরেজ দক্ষতা ম্যাট্রিওশকা রিপ্রেজেন্টেশন লার্নিং (MRL) থেকে আসে। আউটপুট ভেক্টরগুলিকে গতিশীলভাবে 768 মাত্রা থেকে 512, 256 বা 128 মাত্রায় ছোট করা যেতে পারে, যা স্থানীয় ভেক্টর ডাটাবেস এবং মেমরি ব্যবহারের জন্য 6x স্টোরেজ হ্রাস পর্যন্ত সরবরাহ করে। ফোন বা এমবেডেড হার্ডওয়্যারে পুনরুদ্ধার চালাচ্ছেন ডেভেলপারদের জন্য, এই পার্থক্যটি প্রায়শই নির্ধারণ করে যে কোনও বৈশিষ্ট্য আদৌ আসে কিনা।

টাইট হার্ডওয়্যার বাজেটের জন্য ডিজাইন করা হয়েছে

অন-ডিভাইস ফুটপ্রিন্ট হল মডেলের মূল বিক্রয় পয়েন্ট। কোয়ান্টাইজেশনের সাথে, Google রিপোর্ট করে যে এমবেডিংগেমা 2-এর জন্য শুধুমাত্র টেক্সট-ওয়েটের জন্য প্রায় 191MB সক্রিয় RAM এবং Google Pixel 11 Pro-তে সম্পূর্ণ মাল্টিমডাল মডেলের জন্য প্রায় 567MB প্রয়োজন। প্রসঙ্গ উইন্ডোটি 8,000 টোকেনেও বেড়েছে, যা EmbeddingGemma 1 এর চেয়ে চারগুণ বড়, যা 5.5 মিনিটের অডিও, 29টি ছবি, বা 58টি ভিডিও ফ্রেম একক পাসে প্রক্রিয়া করার জন্য যথেষ্ট, বা এর ইন্টারলিভড কম্বিনেশন।

যেহেতু মডেলটি তার টেক্সট টোকেনাইজার এবং অডিও এনকোডার জেমমা 4 এর সাথে শেয়ার করে, ডেভেলপাররা কম সম্মিলিত মেমরি ফুটপ্রিন্ট সহ একটি ইউনিফাইড পাইপলাইনে জেমা 4 এর পাশাপাশি এমবেডিংগেমা 2 চালাতে পারে, যা ডিভাইসে RAG সক্ষম করে যেখানে পুনরুদ্ধার এবং প্রজন্ম উভয়ই স্থানীয়ভাবে হয়। Gemma 4 প্রাসঙ্গিক যুক্তির সাথে স্থানীয় ফাইল পুনরুদ্ধারকে যুক্ত করে Google তার AI Edge Foresight অ্যাপে এটি প্রদর্শন করে।

টুলিং এবং উপলব্ধতা

মডেলটি গুগলের এআই এজ টুলিংয়ের মাধ্যমে উপলব্ধ। Google AI Edge Gallery অ্যাপটি ইনস্ট্যান্ট মিডিয়া সার্চ দেখায়, যা টেক্সট বা ইমেজ কোয়েরি থেকে শব্দার্থগত মিলের মাধ্যমে লাইব্রেরি মিল খুঁজে পায় এবং একটি ভিডিও মোমেন্টস ফাইন্ডার যা পাঠ্য বা অডিও কোয়েরি ব্যবহার করে নির্দিষ্ট দৃশ্যগুলি সনাক্ত করে। রিয়েল-টাইম শ্রেণীবিভাগ, রাউটিং, এবং ভবিষ্যদ্বাণীমূলক ব্যবহারের ক্ষেত্রে মিডিয়াপাইপ ডিসিশন টাস্ক API এর মাধ্যমে উন্মুক্ত করা হয় এবং Google এর AI এজ ব্লগ ডকুমেন্টগুলি কীভাবে LiteRT এর সাথে ডিভাইসে অনুসন্ধান এবং RAG সিস্টেম তৈরি করতে হয়। মডেল কার্ডে সম্পূর্ণ মূল্যায়ন মেট্রিক্স পাওয়া যায়।

কেন ডিভাইসে এম্বেডিং গুরুত্বপূর্ণ

এম্বেডিং মডেলগুলি খুব কমই শিরোনাম তৈরি করে যেভাবে ফ্রন্টিয়ার চ্যাট মডেলগুলি করে, তবে তারা সবচেয়ে ব্যবহারিক AI বৈশিষ্ট্যগুলির নীচে বসে: শব্দার্থিক অনুসন্ধান, সুপারিশ, অনুলিপি, শ্রেণিবিন্যাস এবং RAG-এর জন্য পুনরুদ্ধার। স্থানীয়ভাবে তাদের চালানো গোপনীয়তা এবং লেটেন্সি ক্যালকুলাস সম্পূর্ণরূপে পরিবর্তন করে। ডেটা কখনই ডিভাইস ছেড়ে যায় না, ক্যোয়ারী অফলাইনে কাজ করে এবং প্রতি-কল API খরচ নেই, যা বিলিয়ন এমবেডেড ডিভাইসের স্কেলে গুরুত্বপূর্ণ।

EmbeddingGemma 2 দক্ষ ওপেন-মডেল স্পেসে প্রতিযোগিতা আরও তীব্র করে, যেখানে Google, Meta, Mistral এবং ছোট ল্যাবগুলির একটি দল প্রমাণ করতে দৌড়াচ্ছে যে দরকারী AI ডেটা সেন্টার ছাড়াই চলতে পারে। একটি 740M-প্যারামিটার মডেল একটি ফোনে পাঁচটি পদ্ধতি পরিচালনা করে সেই দৌড়ে একটি উল্লেখযোগ্য চিহ্নিতকারী৷ যদি এর পূর্বসূরীর ডাউনলোড ট্র্যাজেক্টোরি কোন ইঙ্গিত হয়, আশা করুন যে এমবেডিংগেমা 2 আসন্ন মাসগুলিতে মোবাইল এবং প্রান্ত পণ্যগুলির বিস্তৃত পরিসরে প্রদর্শিত হবে।

এআই কার্ভ থেকে এগিয়ে থাকুন

অন-ডিভাইস AI বেশির ভাগ লোকের ধারণার চেয়ে দ্রুত অগ্রসর হচ্ছে। aibuzzwire.news-এ সর্বশেষ AI খবর পড়ুন প্রতিটি বড় মডেল লঞ্চ, বেঞ্চমার্ক এবং ডেভেলপার টুল রিলিজের কভারেজের জন্য।

আরও এআই খবর পড়ুন →