گوگل بی سر و صدا دو به روز رسانی قابل توجه مدل Gemini را در عرض 48 ساعت در این هفته ارسال کرد و هر دو دقیقاً برای توسعه دهندگانی که برنامه های تولیدی را ایجاد می کنند، هدف قرار می گیرند. بر اساس وبلاگ رسمی گوگل، Gemini 3.5 Transcribe که در 26 آگوست معرفی شد، دقیق ترین مدل گفتار به متن این شرکت تا به امروز است. Gemini Omni 1.1 Flash که در 27 آگوست معرفی شد، کنترلهای حرفهای را برای ویدیوهای تولیدی، از جمله گسترش صحنه تا 40 ثانیه و ارتقاء 4K به ارمغان میآورد. هر دو مدل از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس هستند.
Gemini 3.5 رونویسی: گفتار به متن که بعد از خودش پاک میشود For more context on this story, see our ongoing latest AI developments.
گوگل می گوید آنچه Gemini 3.5 Transcribe را از تشخیص گفتار معمولی متمایز می کند این است که صدای خام را مستقیماً به متن صیقلی و فرمت شده تبدیل می کند تا رونوشت خام. این مدل نویز پسزمینه، اصطلاحات پیچیده و پاکسازی ناروانی را بهطور بومی مدیریت میکند - کلمات پرکنندهای مانند "ums" و "ahs" را حذف میکند، تصحیحهای خود مانند "بیایید سهشنبه را ملاقات کنیم، نه، چهارشنبه" را حل میکند و خروجی را به صورت خودکار قالببندی میکند.
اعداد بنچمارکی که گوگل به آنها اشاره کرده قابل توجه است. همانطور که توسط تجزیه و تحلیل مصنوعی اندازه گیری شد، این مدل به میانگین نرخ خطای کلمه (WER) 4.0 درصد برای موارد استفاده از پخش جریانی و 2.6 درصد برای صدای غیر جریانی دست می یابد. در معیار چندزبانه FLEURS در بین زبانهای برتر، 5.50 درصد WER در حالت پخش و 5.04 درصد غیرجریان است که در مدل رونویسی قبلی Google، Chirp 3 بهبود یافته است. زمان تا رونویسی نهایی در مقایسه با Chirp 3 70 درصد بهبود مییابد، که مجدداً توسط Artificial Analy اندازهگیری شده است.
این مدل در دو نوع برای دو گردش کار ارسال می شود. برای برنامههای کاربردی زنده، «gemini-3.5-transscribe-live» جریان دو طرفه پیوسته را با تأخیر زیر ثانیه از طریق Live API ارائه میکند و عوامل صوتی را هدف قرار میدهد و زیرنویسهای همزمان را هدف قرار میدهد. برای صدای ضبطشده - جلسات، گزارش تماسها، بایگانیها - «gemini-3.5-transscribe» انتساب بلندگو را برای حداکثر سه سخنران (با پشتیبانی از موارد بیشتر در حالت آزمایشی) و مهرهای زمانی در سطح کلمه از طریق Interactions API ارائه میکند.
قابلیتهای دیگر شامل تشخیص و رونویسی خودکار در بیش از 85 زبان با استفاده از لهجه و گویش، و پشتیبانی از واژگان سفارشی است، بنابراین مدل با اصطلاحات تخصصی و املای منحصر به فرد سازگار میشود. گوگل همچنین چشمهای مدل را به نوعی ارائه داد: از طریق فراخوانی تابع، میتواند وظایفی مانند تولید تصویر یا تجزیه و تحلیل فایل را به دیگر مدلهای Gemini محول کند - قابلیتی که در حال حاضر در برنامه Gemini در macOS موجود است.
فلش Gemini Omni 1.1: تولید ویدئو یک جدول زمانی را افزایش می دهد
راه اندازی دوم به رایج ترین شکایت در مورد ویدیوی هوش مصنوعی می پردازد: کنترل. Gemini Omni 1.1 Flash یک بهروزرسانی متمرکز بر تولید است که باعث میشود ویدیوهای تولیدی به شیوهای که پیشینیانش نبودند، هدایت شوند، با مدیران محصول Google DeepMind، Anish Nangia و Alisa Fortin، انتشار را بهعنوان ساخت Omni 1.1 «آماده تولید برای استفاده حرفهای» توصیف کردند.
پسوند صحنه ویژگی تیتر است. توسعهدهندگان اکنون میتوانند به تولید یکپارچه فیلم از یک کلیپ موجود ادامه دهند، با مدلی که حداکثر 10 ثانیه از زمینه قبلی را تجزیه و تحلیل میکند - جهشی از مدلهای قبلی که تنها به ثانیه آخر اشاره میکردند. ویدئوها را میتوان در 10 ثانیه تا طول 40 ثانیه افزایش داد، که ثبات بصری و پایبندی روایت را برای داستانهای طولانیتر بهبود میبخشد.
این بهروزرسانی همچنین درونیابی فریم اول و آخر را اضافه میکند و به توسعهدهندگان اجازه میدهد تا فریمهای شروع و پایان را برای ایجاد حرکات صاف و عمدی دوربین و انتقال بین عکسها مشخص کنند. برای تحویل، پروژههای تمامشده را میتوان تا رزولوشن 4K ارتقا داد، در حالی که حالت پیشنمایش 360p به سازندگان اجازه میدهد تا قبل از انجام رندرهای نهایی، سریع و ارزان درخواستها را تکرار کنند.
از API تا سطوح روزمره
گوگل همچنین در حال اتصال هر دو مدل به محصولات مصرفی خود است که مزیت توزیع آن را نشان می دهد. در اندروید، ویژگی جدید «Rambler» در Gboard از 3.5 رونویسی استفاده میکند تا افکار گفتاری را به متنی با قالببندی مناسب تبدیل کند، در حالی که کلمات پرکننده را فیلتر میکند - کاربران حتی میتوانند با صدا ویرایشها را انجام دهند. این مدل همچنین دیکته را در برنامه Gemini در macOS قدرت میدهد، در کنار زمینه صفحه نمایش در Google Antigravity کار میکند و در Chrome ادغام میشود.
برای توسعهدهندگان، این دو راهاندازی بهعنوان یک استراتژی خوانده میشود: Google Gemini را از چتباتی که با آن صحبت میکنید به زیرساختهایی که رسانهها را میبیند، میشنود و تولید میکند، سوق میدهد. با OpenAI، ElevenLabs و گروهی از استارتآپهای ویدیویی که در یک منطقه با هم رقابت میکنند، نرخ خطای کلمه 2.6 درصد و صحنههای منسجم 40 ثانیهای پیشنهاد افتتاحیه Google برای بارهای کاری تولیدی است که در واقع درآمدزایی میکنند - عوامل صوتی، خطوط لوله زیرنویس، و ابزار خلاق. توسعه دهندگان می توانند از امروز با هر دو مدل در Google AI Studio شروع به ساختن کنند.
چرا میزان خطای کلمه هنوز مهم است
نرخ خطای کلمه مانند یک آمار آکادمیک به نظر می رسد، اما در تولید، تفاوت بین یک محصول صوتی که کار می کند و محصولی است که ناامید کننده است. هر گفته نادرست در یک عامل صوتی، وظیفه ای را بر هم می زند: شناسه سفارش نادرست، جستجوی ناموفق را آغاز می کند، یک آدرس درهم، بسته ای را به شهر اشتباهی می فرستد. به همین دلیل است که شکاف بین 2.6 درصد WER در صدای غیر جریانی و نرخهای تک رقمی بالا که در نسلی از مدلهای پیش رایج بود، باعث تفاوت درجهای در قابلیت استفاده میشود.
تمایز بین دو حالتی که گوگل گزارش کرده نیز برای معماران مهم است. رونویسی جریانی - رقم 4.0 درصد WER - مقداری دقت را با تأخیر فرعی ثانویه عوض میکند، که موارد استفاده تعاملی مانند عوامل صوتی زنده به آن نیاز دارند. رونویسی دسته ای صدای ضبط شده کندتر انجام می شود اما به 2.6 درصد می رسد، به همین دلیل است که تجزیه و تحلیل پس از تماس و پردازش بایگانی می تواند سخت تر باشد. تصمیم Google برای نمایش هر دو به عنوان نقاط پایانی مدل مجزا به جای یک تنظیم قابل تنظیم، تصدیق می کند که توسعه دهندگان محصولات متفاوتی را در هر دو طرف این مبادله می سازند.
یک گردش کار ردیفی برای تولید ویدئو
به روز رسانی Omni 1.1 Flash به همان اندازه در مورد چگونگی انجام کار خلاقانه عملی است. تکرار ویدیوی تولیدی گران بوده است: هر آزمایش سریع به معنای ارائه کامل است. حالت پیشنمایش 360p جدید، کاوش را از تحویل جدا میکند، و به سازندگان اجازه میدهد تغییرات سریع را با قیمت ارزان طی کنند و فقط برای ارتقای کیفیت 4K روی عکسهایی که از بازبینی باقی میمانند، بپردازند.
مکانیک گسترش صحنه به مشکل انسجامی که ویدیوهای هوش مصنوعی را در محله یهودی نشین به اندازه کلیپ نگه داشته است، می پردازد. با تجزیه و تحلیل 10 ثانیه از زمینه قبلی به جای تنها فریم نهایی، این مدل می تواند یک صحنه را در 10 ثانیه تا 40 ثانیه گسترش دهد و در عین حال شخصیت ها، نور و سبک بصری را ثابت نگه دارد. همراه با درون یابی فریم اول و آخر - که به ویراستاران نقاط کنترل قطعی می دهد، نشانگرهای ورودی و خروجی در ویرایش مرسوم کار می کنند - فیلم های تولید شده توسط هوش مصنوعی به جای اینکه به طور عمده جایگزین شوند، در خطوط لوله واقعی پس از تولید قرار می گیرند.
تصویر رقابتی
هر دو راه اندازی گوگل را به عنوان زیرساخت به جای مقصد قرار می دهند. در گفتار، گوگل فروشندگان تخصصی رونویسی و پشته های صوتی رقبای ابری خود را با ترکیب کردن دقت پیشرفته در Gemini API که توسعه دهندگانش قبلاً از آن استفاده می کردند، می پذیرد. در ویدئو، در بازاری پر از استارتآپهای دارای بودجه خوب با تاکید بر کنترل و یکپارچهسازی گردش کار بر روی عینک خام رقابت میکند.
مزیت توزیع ممکن است عامل تعیین کننده باشد. همان مدل رونویسی که توسعهدهندگان میتوانند از Gemini API فراخوانی کنند، دیکته رامبلر Gboard را در اندروید، برنامه Gemini در macOS، Google Antigravity و Chrome را تقویت میکند - به این معنی که Google میتواند توسعه مدل را در میان میلیاردها تعامل کاربر جمعآوری کند و در عین حال صداهای مختلف دنیای واقعی را جمعآوری کند که مدام آن را بهبود میبخشد. برای توسعه دهندگانی که در سال 2026 یک پشته سخنرانی یا ویدیو را انتخاب می کنند، این چرخ لنگر اکنون بخشی از زمین است.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →