گوگل بی سر و صدا دو به روز رسانی قابل توجه مدل Gemini را در عرض 48 ساعت در این هفته ارسال کرد و هر دو دقیقاً برای توسعه دهندگانی که برنامه های تولیدی را ایجاد می کنند، هدف قرار می گیرند. بر اساس وبلاگ رسمی گوگل، Gemini 3.5 Transcribe که در 26 آگوست معرفی شد، دقیق ترین مدل گفتار به متن این شرکت تا به امروز است. Gemini Omni 1.1 Flash که در 27 آگوست معرفی شد، کنترل‌های حرفه‌ای را برای ویدیوهای تولیدی، از جمله گسترش صحنه تا 40 ثانیه و ارتقاء 4K به ارمغان می‌آورد. هر دو مدل از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس هستند.

Gemini 3.5 رونویسی: گفتار به متن که بعد از خودش پاک می‌شود For more context on this story, see our ongoing latest AI developments.

گوگل می گوید آنچه Gemini 3.5 Transcribe را از تشخیص گفتار معمولی متمایز می کند این است که صدای خام را مستقیماً به متن صیقلی و فرمت شده تبدیل می کند تا رونوشت خام. این مدل نویز پس‌زمینه، اصطلاحات پیچیده و پاک‌سازی ناروانی را به‌طور بومی مدیریت می‌کند - کلمات پرکننده‌ای مانند "ums" و "ahs" را حذف می‌کند، تصحیح‌های خود مانند "بیایید سه‌شنبه را ملاقات کنیم، نه، چهارشنبه" را حل می‌کند و خروجی را به صورت خودکار قالب‌بندی می‌کند.

اعداد بنچمارکی که گوگل به آنها اشاره کرده قابل توجه است. همانطور که توسط تجزیه و تحلیل مصنوعی اندازه گیری شد، این مدل به میانگین نرخ خطای کلمه (WER) 4.0 درصد برای موارد استفاده از پخش جریانی و 2.6 درصد برای صدای غیر جریانی دست می یابد. در معیار چندزبانه FLEURS در بین زبان‌های برتر، 5.50 درصد WER در حالت پخش و 5.04 درصد غیرجریان است که در مدل رونویسی قبلی Google، Chirp 3 بهبود یافته است. زمان تا رونویسی نهایی در مقایسه با Chirp 3 70 درصد بهبود می‌یابد، که مجدداً توسط Artificial Analy اندازه‌گیری شده است.

این مدل در دو نوع برای دو گردش کار ارسال می شود. برای برنامه‌های کاربردی زنده، «gemini-3.5-transscribe-live» جریان دو طرفه پیوسته را با تأخیر زیر ثانیه از طریق Live API ارائه می‌کند و عوامل صوتی را هدف قرار می‌دهد و زیرنویس‌های هم‌زمان را هدف قرار می‌دهد. برای صدای ضبط‌شده - جلسات، گزارش تماس‌ها، بایگانی‌ها - «gemini-3.5-transscribe» انتساب بلندگو را برای حداکثر سه سخنران (با پشتیبانی از موارد بیشتر در حالت آزمایشی) و مهرهای زمانی در سطح کلمه از طریق Interactions API ارائه می‌کند.

قابلیت‌های دیگر شامل تشخیص و رونویسی خودکار در بیش از 85 زبان با استفاده از لهجه و گویش، و پشتیبانی از واژگان سفارشی است، بنابراین مدل با اصطلاحات تخصصی و املای منحصر به فرد سازگار می‌شود. گوگل همچنین چشم‌های مدل را به نوعی ارائه داد: از طریق فراخوانی تابع، می‌تواند وظایفی مانند تولید تصویر یا تجزیه و تحلیل فایل را به دیگر مدل‌های Gemini محول کند - قابلیتی که در حال حاضر در برنامه Gemini در macOS موجود است.

فلش Gemini Omni 1.1: تولید ویدئو یک جدول زمانی را افزایش می دهد

راه اندازی دوم به رایج ترین شکایت در مورد ویدیوی هوش مصنوعی می پردازد: کنترل. Gemini Omni 1.1 Flash یک به‌روزرسانی متمرکز بر تولید است که باعث می‌شود ویدیوهای تولیدی به شیوه‌ای که پیشینیانش نبودند، هدایت شوند، با مدیران محصول Google DeepMind، Anish Nangia و Alisa Fortin، انتشار را به‌عنوان ساخت Omni 1.1 «آماده تولید برای استفاده حرفه‌ای» توصیف کردند.

پسوند صحنه ویژگی تیتر است. توسعه‌دهندگان اکنون می‌توانند به تولید یکپارچه فیلم از یک کلیپ موجود ادامه دهند، با مدلی که حداکثر 10 ثانیه از زمینه قبلی را تجزیه و تحلیل می‌کند - جهشی از مدل‌های قبلی که تنها به ثانیه آخر اشاره می‌کردند. ویدئوها را می‌توان در 10 ثانیه تا طول 40 ثانیه افزایش داد، که ثبات بصری و پایبندی روایت را برای داستان‌های طولانی‌تر بهبود می‌بخشد.

این به‌روزرسانی همچنین درون‌یابی فریم اول و آخر را اضافه می‌کند و به توسعه‌دهندگان اجازه می‌دهد تا فریم‌های شروع و پایان را برای ایجاد حرکات صاف و عمدی دوربین و انتقال بین عکس‌ها مشخص کنند. برای تحویل، پروژه‌های تمام‌شده را می‌توان تا رزولوشن 4K ارتقا داد، در حالی که حالت پیش‌نمایش 360p به سازندگان اجازه می‌دهد تا قبل از انجام رندرهای نهایی، سریع و ارزان درخواست‌ها را تکرار کنند.

از API تا سطوح روزمره

گوگل همچنین در حال اتصال هر دو مدل به محصولات مصرفی خود است که مزیت توزیع آن را نشان می دهد. در اندروید، ویژگی جدید «Rambler» در Gboard از 3.5 رونویسی استفاده می‌کند تا افکار گفتاری را به متنی با قالب‌بندی مناسب تبدیل کند، در حالی که کلمات پرکننده را فیلتر می‌کند - کاربران حتی می‌توانند با صدا ویرایش‌ها را انجام دهند. این مدل همچنین دیکته را در برنامه Gemini در macOS قدرت می‌دهد، در کنار زمینه صفحه نمایش در Google Antigravity کار می‌کند و در Chrome ادغام می‌شود.

برای توسعه‌دهندگان، این دو راه‌اندازی به‌عنوان یک استراتژی خوانده می‌شود: Google Gemini را از چت‌باتی که با آن صحبت می‌کنید به زیرساخت‌هایی که رسانه‌ها را می‌بیند، می‌شنود و تولید می‌کند، سوق می‌دهد. با OpenAI، ElevenLabs و گروهی از استارت‌آپ‌های ویدیویی که در یک منطقه با هم رقابت می‌کنند، نرخ خطای کلمه 2.6 درصد و صحنه‌های منسجم 40 ثانیه‌ای پیشنهاد افتتاحیه Google برای بارهای کاری تولیدی است که در واقع درآمدزایی می‌کنند - عوامل صوتی، خطوط لوله زیرنویس، و ابزار خلاق. توسعه دهندگان می توانند از امروز با هر دو مدل در Google AI Studio شروع به ساختن کنند.

چرا میزان خطای کلمه هنوز مهم است

نرخ خطای کلمه مانند یک آمار آکادمیک به نظر می رسد، اما در تولید، تفاوت بین یک محصول صوتی که کار می کند و محصولی است که ناامید کننده است. هر گفته نادرست در یک عامل صوتی، وظیفه ای را بر هم می زند: شناسه سفارش نادرست، جستجوی ناموفق را آغاز می کند، یک آدرس درهم، بسته ای را به شهر اشتباهی می فرستد. به همین دلیل است که شکاف بین 2.6 درصد WER در صدای غیر جریانی و نرخ‌های تک رقمی بالا که در نسلی از مدل‌های پیش رایج بود، باعث تفاوت درجه‌ای در قابلیت استفاده می‌شود.

تمایز بین دو حالتی که گوگل گزارش کرده نیز برای معماران مهم است. رونویسی جریانی - رقم 4.0 درصد WER - مقداری دقت را با تأخیر فرعی ثانویه عوض می‌کند، که موارد استفاده تعاملی مانند عوامل صوتی زنده به آن نیاز دارند. رونویسی دسته ای صدای ضبط شده کندتر انجام می شود اما به 2.6 درصد می رسد، به همین دلیل است که تجزیه و تحلیل پس از تماس و پردازش بایگانی می تواند سخت تر باشد. تصمیم Google برای نمایش هر دو به عنوان نقاط پایانی مدل مجزا به جای یک تنظیم قابل تنظیم، تصدیق می کند که توسعه دهندگان محصولات متفاوتی را در هر دو طرف این مبادله می سازند.

یک گردش کار ردیفی برای تولید ویدئو

به روز رسانی Omni 1.1 Flash به همان اندازه در مورد چگونگی انجام کار خلاقانه عملی است. تکرار ویدیوی تولیدی گران بوده است: هر آزمایش سریع به معنای ارائه کامل است. حالت پیش‌نمایش 360p جدید، کاوش را از تحویل جدا می‌کند، و به سازندگان اجازه می‌دهد تغییرات سریع را با قیمت ارزان طی کنند و فقط برای ارتقای کیفیت 4K روی عکس‌هایی که از بازبینی باقی می‌مانند، بپردازند.

مکانیک گسترش صحنه به مشکل انسجامی که ویدیوهای هوش مصنوعی را در محله یهودی نشین به اندازه کلیپ نگه داشته است، می پردازد. با تجزیه و تحلیل 10 ثانیه از زمینه قبلی به جای تنها فریم نهایی، این مدل می تواند یک صحنه را در 10 ثانیه تا 40 ثانیه گسترش دهد و در عین حال شخصیت ها، نور و سبک بصری را ثابت نگه دارد. همراه با درون یابی فریم اول و آخر - که به ویراستاران نقاط کنترل قطعی می دهد، نشانگرهای ورودی و خروجی در ویرایش مرسوم کار می کنند - فیلم های تولید شده توسط هوش مصنوعی به جای اینکه به طور عمده جایگزین شوند، در خطوط لوله واقعی پس از تولید قرار می گیرند.

تصویر رقابتی

هر دو راه اندازی گوگل را به عنوان زیرساخت به جای مقصد قرار می دهند. در گفتار، گوگل فروشندگان تخصصی رونویسی و پشته های صوتی رقبای ابری خود را با ترکیب کردن دقت پیشرفته در Gemini API که توسعه دهندگانش قبلاً از آن استفاده می کردند، می پذیرد. در ویدئو، در بازاری پر از استارت‌آپ‌های دارای بودجه خوب با تاکید بر کنترل و یکپارچه‌سازی گردش کار بر روی عینک خام رقابت می‌کند.

مزیت توزیع ممکن است عامل تعیین کننده باشد. همان مدل رونویسی که توسعه‌دهندگان می‌توانند از Gemini API فراخوانی کنند، دیکته رامبلر Gboard را در اندروید، برنامه Gemini در macOS، Google Antigravity و Chrome را تقویت می‌کند - به این معنی که Google می‌تواند توسعه مدل را در میان میلیاردها تعامل کاربر جمع‌آوری کند و در عین حال صداهای مختلف دنیای واقعی را جمع‌آوری کند که مدام آن را بهبود می‌بخشد. برای توسعه دهندگانی که در سال 2026 یک پشته سخنرانی یا ویدیو را انتخاب می کنند، این چرخ لنگر اکنون بخشی از زمین است.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →