Google শান্তভাবে এই সপ্তাহে 48 ঘন্টার মধ্যে দুটি উল্লেখযোগ্য জেমিনি মডেল আপডেট পাঠিয়েছে, এবং উভয়ই উৎপাদন অ্যাপ্লিকেশন তৈরির বিকাশকারীদের লক্ষ্য করে। গুগলের অফিসিয়াল ব্লগ অনুসারে, Gemini 3.5 ট্রান্সক্রাইব, 26 অগাস্ট চালু করা হয়েছে, এটি কোম্পানির এখন পর্যন্ত সবচেয়ে সুনির্দিষ্ট স্পিচ-টু-টেক্সট মডেল। জেমিনি ওমনি 1.1 ফ্ল্যাশ, 27 অগাস্ট ঘোষিত, 40 সেকেন্ড পর্যন্ত দৃশ্য এক্সটেনশন এবং 4K আপস্কেলিং সহ জেনারেটিভ ভিডিওতে পেশাদার-গ্রেড নিয়ন্ত্রণ নিয়ে আসে। উভয় মডেলই Google AI স্টুডিওতে Gemini API এবং Gemini Enterprise Agent Platform-এর মাধ্যমে উপলব্ধ।

মিথুন 3.5 ট্রান্সক্রাইব: স্পিচ-টু-টেক্সট যা নিজের পরে পরিষ্কার করে For more context on this story, see our ongoing more AI stories.

প্রচলিত স্পিচ রিকগনিশন থেকে Gemini 3.5 ট্রান্সক্রাইবকে কী আলাদা করে, গুগল বলে, এটি কাঁচা ট্রান্সক্রিপ্টের পরিবর্তে কাঁচা অডিওকে সরাসরি পালিশ, ফরম্যাটেড টেক্সটে রূপান্তর করে। মডেলটি নেটিভভাবে ব্যাকগ্রাউন্ড নয়েজ, জটিল শব্দার্থ, এবং ডিসফ্লুয়েন্সি ক্লিনআপ পরিচালনা করে — এটি "ums" এবং "ahs" এর মতো ফিলার শব্দগুলিকে সরিয়ে দেয়, "আসুন মঙ্গলবার-না, বুধবার" এর মতো স্ব-সংশোধনগুলি সমাধান করে এবং আউটপুটটিকে স্বয়ংক্রিয়ভাবে ফর্ম্যাট করে৷

Google উদ্ধৃত বেঞ্চমার্ক নম্বরগুলি উল্লেখযোগ্য। কৃত্রিম বিশ্লেষণ দ্বারা পরিমাপ করা হয়েছে, মডেলটি স্ট্রিমিং ব্যবহারের ক্ষেত্রে 4.0 শতাংশ এবং নন-স্ট্রিমিং অডিওর জন্য 2.6 শতাংশ গড় শব্দ ত্রুটি হার (WER) অর্জন করে। শীর্ষস্থানীয় ভাষা জুড়ে FLEURS বহুভাষিক বেঞ্চমার্কে, এটি স্ট্রিমিং মোডে 5.50 শতাংশ WER এবং 5.04 শতাংশ নন-স্ট্রিমিং পোস্ট করে, যা Google-এর পূর্ববর্তী ট্রান্সক্রিপশন মডেল, Chirp 3-তে উন্নতি করে। Chirp 3-এর তুলনায় চূড়ান্ত ট্রান্সক্রিপশনের সময় 70 শতাংশ উন্নত হয়েছে, আবার কৃত্রিম বিশ্লেষণ দ্বারা পরিমাপ করা হয়েছে।

দুটি কর্মপ্রবাহের জন্য মডেল দুটি ভেরিয়েন্টে পাঠানো হয়। লাইভ অ্যাপ্লিকেশনের জন্য, `gemini-3.5-ট্রান্সক্রাইব-লাইভ` লাইভ API-এর মাধ্যমে সাব-সেকেন্ড লেটেন্সি সহ অবিচ্ছিন্ন দ্বিমুখী স্ট্রিমিং প্রদান করে, ভয়েস এজেন্টদের লক্ষ্য করে এবং রিয়েল-টাইম ক্যাপশনিং। রেকর্ড করা অডিওর জন্য — মিটিং, কল লগ, আর্কাইভ — `জেমিনি-৩.৫-ট্রান্সক্রাইব` তিনজন পর্যন্ত স্পিকার অ্যাট্রিবিউশন (পরীক্ষামূলক মোডে আরও সমর্থন সহ) এবং ইন্টারঅ্যাকশন API-এর মাধ্যমে ওয়ার্ড-লেভেল টাইমস্ট্যাম্প অফার করে।

অন্যান্য ক্ষমতাগুলির মধ্যে রয়েছে স্বয়ংক্রিয় সনাক্তকরণ এবং 85টিরও বেশি ভাষায় উচ্চারণ এবং উপভাষা পরিচালনা সহ ট্রান্সক্রিপশন, এবং কাস্টম শব্দভান্ডার সমর্থন যাতে মডেলটি বিশেষ জারগন এবং অনন্য বানানের সাথে খাপ খায়। Google একটি সাজানোর মডেল চোখও দিয়েছে: ফাংশন কলিংয়ের মাধ্যমে, এটি অন্যান্য জেমিনি মডেলগুলিতে ইমেজ তৈরি বা ফাইল বিশ্লেষণের মতো কাজগুলি অর্পণ করতে পারে - একটি বৈশিষ্ট্য যা বর্তমানে ম্যাকওএস-এ জেমিনি অ্যাপে উপলব্ধ।

Gemini Omni 1.1 Flash: ভিডিও জেনারেশন একটি টাইমলাইন বৃদ্ধি করে৷

দ্বিতীয় লঞ্চটি এআই ভিডিও সম্পর্কে সবচেয়ে সাধারণ অভিযোগের সমাধান করে: নিয়ন্ত্রণ। জেমিনি ওমনি 1.1 ফ্ল্যাশ হল একটি প্রোডাকশন-কেন্দ্রিক আপডেট যা এর পূর্বসূরিদের মতো নয় এমনভাবে জেনারেটিভ ভিডিওকে স্টিয়ারেবল করে তোলে, Google ডিপমাইন্ড প্রোডাক্ট ম্যানেজার অনীশ নাঙ্গিয়া এবং আলিসা ফোর্টিন রিলিজটিকে Omni 1.1 "পেশাদার ব্যবহারের জন্য প্রস্তুত" হিসাবে বর্ণনা করেছেন।

দৃশ্য সম্প্রসারণ শিরোনাম বৈশিষ্ট্য. বিকাশকারীরা এখন একটি বিদ্যমান ক্লিপ থেকে নির্বিঘ্নে ফুটেজ তৈরি করা চালিয়ে যেতে পারে, মডেলটি 10 ​​সেকেন্ড পর্যন্ত পূর্বের প্রসঙ্গ বিশ্লেষণ করে - পূর্ববর্তী মডেলগুলির থেকে একটি লাফ যা শুধুমাত্র চূড়ান্ত সেকেন্ডের উল্লেখ করে। ভিডিওগুলি 10-সেকেন্ডের বৃদ্ধিতে 40 সেকেন্ডের ক্রমবর্ধমান দৈর্ঘ্য পর্যন্ত প্রসারিত করা যেতে পারে, দীর্ঘ গল্পগুলির জন্য ভিজ্যুয়াল সামঞ্জস্য এবং বর্ণনার আনুগত্য উন্নত করে৷

আপডেটটি প্রথম-এবং-শেষ-ফ্রেম ইন্টারপোলেশনও যোগ করে, বিকাশকারীদের মসৃণ, ইচ্ছাকৃত ক্যামেরা মুভমেন্ট এবং শটগুলির মধ্যে স্থানান্তর তৈরি করতে শুরু এবং শেষ ফ্রেমগুলি নির্দিষ্ট করতে দেয়। ডেলিভারির জন্য, সমাপ্ত প্রকল্পগুলিকে 4K রেজোলিউশনে উন্নীত করা যেতে পারে, যখন একটি 360p প্রিভিউ মোড ক্রিয়েটরদের চূড়ান্ত রেন্ডার করার আগে দ্রুত এবং সস্তায় প্রম্পটে পুনরাবৃত্তি করতে দেয়।

API থেকে দৈনন্দিন সারফেস পর্যন্ত

গুগল উভয় মডেলকে তার ভোক্তা পণ্যগুলিতে ওয়্যারিং করছে, যেখানে এর বিতরণ সুবিধা দেখায়। অ্যান্ড্রয়েডে, Gboard-এর নতুন "Rambler" বৈশিষ্ট্যটি ফিলার শব্দগুলি ফিল্টার করার সময় কথ্য চিন্তাভাবনাগুলিকে ভাল-ফরম্যাট করা পাঠ্যে রূপান্তর করতে 3.5 ট্রান্সক্রাইব ব্যবহার করে — ব্যবহারকারীরা এমনকি ভয়েস দ্বারা সম্পাদনাও করতে পারে৷ মডেলটি ম্যাকওএস-এ জেমিনি অ্যাপে ডিক্টেশনের ক্ষমতা দেয়, গুগল অ্যান্টিগ্র্যাভিটিতে স্ক্রিন প্রসঙ্গে কাজ করে এবং ক্রোমে একত্রিত করা হচ্ছে।

ডেভেলপারদের জন্য, দুটি লঞ্চ একটি কৌশল হিসাবে পড়ে: Google আপনার কথা বলার একটি চ্যাটবট থেকে মিথুনকে এমন অবকাঠামোতে ঠেলে দিচ্ছে যা মিডিয়া দেখে, শোনে এবং উত্পাদন করে। OpenAI, ElevenLabs, এবং একই অঞ্চলে প্রতিদ্বন্দ্বিতাকারী ভিডিও স্টার্টআপগুলির একটি দল, 2.6 শতাংশ শব্দ ত্রুটির হার এবং 40-সেকেন্ডের সুসংগত দৃশ্যগুলি হল Google-এর প্রারম্ভিক বিড উৎপাদন কাজের চাপ যা প্রকৃতপক্ষে আয় তৈরি করে — ভয়েস এজেন্ট, ক্যাপশনিং পাইপলাইন এবং সৃজনশীল সরঞ্জাম। বিকাশকারীরা আজই Google AI স্টুডিওতে উভয় মডেলের সাথে নির্মাণ শুরু করতে পারেন।

কেন শব্দ ত্রুটি হার এখনও গুরুত্বপূর্ণ

শব্দ ত্রুটির হার একটি একাডেমিক পরিসংখ্যানের মত শোনাচ্ছে, কিন্তু উত্পাদনে এটি একটি ভয়েস পণ্য যা কাজ করে এবং হতাশ করে তার মধ্যে পার্থক্য। একটি ভয়েস এজেন্টের প্রতিটি ভুল বোঝাবুঝি উচ্চারণ একটি কাজ ভেঙে দেয়: একটি মিসহার্ড অর্ডার আইডি একটি ব্যর্থ লুকআপকে ট্রিগার করে, একটি বিকৃত ঠিকানা ভুল শহরে একটি প্যাকেজ পাঠায়। এই কারণেই নন-স্ট্রিমিং অডিওতে 2.6 শতাংশ WER এবং উচ্চ-সিঙ্গেল-ডিজিট রেটগুলির মধ্যে ব্যবধান যা এক প্রজন্মের আগে প্রচলিত ছিল মডেলগুলির ব্যবহারযোগ্যতার মধ্যে একটি ক্রম-অফ-ম্যাগনিটিউড পার্থক্য।

গুগল রিপোর্ট করা দুটি মোডের মধ্যে পার্থক্য স্থপতিদের জন্যও গুরুত্বপূর্ণ। স্ট্রিমিং ট্রান্সক্রিপশন — 4.0 শতাংশ WER চিত্র — সাব-সেকেন্ড লেটেন্সির জন্য কিছু নির্ভুলতা ট্রেড করে, যা লাইভ ভয়েস এজেন্টের মতো ইন্টারেক্টিভ ব্যবহারের ক্ষেত্রে প্রয়োজন। রেকর্ড করা অডিওর ব্যাচ ট্রান্সক্রিপশন ধীরগতিতে চলে কিন্তু 2.6 শতাংশে পৌঁছায়, যে কারণে পোস্ট-কল বিশ্লেষণ এবং সংরক্ষণাগার প্রক্রিয়াকরণ আরও বেশি চাহিদা বহন করতে পারে। একটি সামঞ্জস্যযোগ্য সেটিং এর পরিবর্তে উভয়কেই আলাদা মডেল এন্ডপয়েন্ট হিসাবে প্রকাশ করার Google-এর সিদ্ধান্ত স্বীকার করে যে বিকাশকারীরা সেই ট্রেডঅফের উভয় পাশে বিভিন্ন পণ্য তৈরি করে৷

ভিডিও উৎপাদনের জন্য একটি টায়ার্ড ওয়ার্কফ্লো

ওমনি 1.1 ফ্ল্যাশ আপডেটটি সৃজনশীল কাজ আসলে কীভাবে ঘটে সে সম্পর্কে সমানভাবে বাস্তবসম্মত। জেনারেটিভ ভিডিও এর সাথে পুনরাবৃত্তি করা ব্যয়বহুল হয়েছে: প্রতিটি প্রম্পট পরীক্ষার অর্থ একটি সম্পূর্ণ রেন্ডার। নতুন 360p প্রিভিউ মোড অন্বেষণকে ডেলিভারি থেকে আলাদা করে, ক্রিয়েটরদের প্রম্পট ভ্যারিয়েশনের মাধ্যমে সস্তায় আবর্তন করতে দেয় এবং শুধুমাত্র পর্যালোচনায় বেঁচে থাকা শটগুলিতে 4K আপস্কেলিংয়ের জন্য অর্থ প্রদান করে।

দৃশ্য এক্সটেনশন মেকানিক্স সুসংগত সমস্যা সমাধান করে যা ক্লিপ-আকারের ঘেটোতে এআই ভিডিও রেখেছে। শুধুমাত্র চূড়ান্ত ফ্রেমের পরিবর্তে 10 সেকেন্ডের পূর্বের প্রসঙ্গ বিশ্লেষণ করে, মডেল অক্ষর, আলো এবং ভিজ্যুয়াল স্টাইল সামঞ্জস্য রেখে 10 সেকেন্ডের বৃদ্ধিতে 40 সেকেন্ড পর্যন্ত একটি দৃশ্য প্রসারিত করতে পারে। প্রথম-এবং-শেষ-ফ্রেম ইন্টারপোলেশনের সাথে একত্রিত — যা সম্পাদকদের নির্ণায়ক নিয়ন্ত্রণ পয়েন্ট দেয়, প্রথাগত সম্পাদনায় মার্কারগুলি যেভাবে কাজ করে — এআই-উত্পাদিত ফুটেজগুলি পাইকারি প্রতিস্থাপনের পরিবর্তে প্রকৃত পোস্ট-প্রোডাকশন পাইপলাইনে ফিট হতে শুরু করে।

প্রতিযোগিতামূলক ছবি

উভয়ই গন্তব্যের পরিবর্তে অবকাঠামো হিসাবে গুগলকে অবস্থান করে। বক্তৃতায়, Google তার ডেভেলপাররা ইতিমধ্যেই ব্যবহার করে এমন Gemini API-এ অত্যাধুনিক নির্ভুলতা বান্ডিল করে বিশেষায়িত ট্রান্সক্রিপশন বিক্রেতা এবং তার ক্লাউড প্রতিদ্বন্দ্বীদের ভয়েস স্ট্যাক নিয়ে যাচ্ছে। ভিডিওতে, এটি কাঁচা দর্শনের উপর নিয়ন্ত্রণ এবং ওয়ার্কফ্লো একীকরণের উপর জোর দিয়ে ভাল-তহবিলযুক্ত স্টার্টআপগুলির ভিড়ে একটি বাজারে প্রতিযোগিতা করছে।

ডিস্ট্রিবিউশন সুবিধা নির্ধারক ফ্যাক্টর হতে পারে। একই ট্রান্সক্রিপশন মডেল যা ডেভেলপাররা Gemini API থেকে কল করতে পারে ইতিমধ্যেই Android-এ Gboard-এর Rambler dictation, macOS-এ Gemini অ্যাপ, Google Antigravity, এবং Chrome-এর ক্ষমতা দেয় — অর্থাৎ Google কোটি কোটি ব্যবহারকারীর ইন্টারঅ্যাকশন জুড়ে মডেল ডেভেলপমেন্টকে বর্জন করতে পারে এবং বিভিন্ন রিয়েল-ওয়ার্ল্ড অডিও সংগ্রহ করতে পারে যা এটিকে উন্নত করে। 2026 সালে একটি স্পিচ বা ভিডিও স্ট্যাক বেছে নেওয়া ডেভেলপারদের জন্য, সেই ফ্লাইহুইলটি এখন পিচের অংশ।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →