Google Gemini 3.5 Transcript را راهاندازی کرده است، یک مدل گفتار به نوشتار جدید که برای رونویسی بیدرنگ ساخته شده است که بیش از ۸۵ زبان را بهطور خودکار تشخیص میدهد - و خروجی را در طول مسیر صیقل میدهد، کلمات پرکننده را حذف میکند و اشتباهات کلامی را بدون درخواست تصحیح میکند.
این راهاندازی، پشته گفتار Google را بهعنوان یک چالش مستقیم در بازار رونویسی رو به رشد قرار میدهد، جایی که دقت و تأخیر به طور فزایندهای تصمیم میگیرد که توسعهدهندگان کدام سرویسها را برای تماسها، جلسات، شرحها و رابطهای صوتی اتخاذ کنند. For more context on this story, see our ongoing latest AI developments.
آنچه مدل می تواند انجام دهد
بر اساس اعلامیه گوگل که پوشش آن توسط The Decoder منتشر شده است، Gemini 3.5 Transcribe فراتر از تبدیل کلمات گفتاری به متن است:
- تشخیص خودکار زبان در بیش از 85 زبان، بدون نیاز به پیکربندی
- حذف کلمه پرکننده، پاکسازی "اوم"، "اوه" و ناهماهنگی های مشابه
- اصلاح لغزش های زبان، تولید نثر خواندنی به جای صدای لفظی
- قالب بندی خودکار متن ، از جمله نقطه گذاری و ساختار
این شرکت نرخ خطای کلمه 4.0 درصد برای پخش صدا و 2.6 درصد برای صدای ضبط شده، در کنار کاهش تأخیر تقریباً 70 درصدی در مقایسه با نسخه قبلی خود Chirp 3 گزارش می کند - یک حاشیه قابل توجه در سناریوهای زیرنویس زنده که در آن تأخیر مکالمات را قطع می کند.
دو رابط برای دو کار
توسعه دهندگان از طریق دو رابط برنامه نویسی کاربردی مجزا دسترسی پیدا می کنند:
Live API — «gemini-3.5-transscribe-live».
پخش همزمان را با تأخیر بسیار کم انجام میدهد، زیرنویسهای زنده، عوامل صوتی و دستیارهای تعاملی را هدف قرار میدهد، جایی که زمان پاسخدهی بیشترین اهمیت را دارد.Interactions API — «gemini-3.5-transscribe».
صداهای ضبط شده را پردازش میکند و رونوشتها را با ذکر منبع سخنران و مُهرهای زمانی برمیگرداند - جریان کاری معمول برای جلسات، مصاحبهها، پادکستها و پس از تولید رسانهها.فراتر از رونویسی، این مدل از تعداد فراخوانی پشتیبانی میکند، به این معنی که میتواند وظایف بعدی را به مدلهای دیگر خانواده Gemini محول کند - به عنوان مثال، درخواست تولید تصویر یا جستجوی وب را بر اساس چیزی که در طول یک جلسه گفته شده است، راهاندازی کند. این یک موتور رونوشت را به یک لایه رابط قابل کنترل برای برنامه های کاربردی صوتی تبدیل می کند.
از قبل در سراسر محصولات Google ارسال شده است
این مدل امروز در Google AI Studio و در پلتفرم عامل سازمانی Gemini برای توسعه دهندگان به صورت زنده ارائه می شود. Google همچنین آن را به سطوح مصرفکننده متصل کرده است: Gboard در Android از آن از طریق یک مؤلفه داخلی به نام Rambler برای دیکته استفاده میکند، برنامه Gemini در macOS آن را برای ورودی صوتی اعمال میکند، و ادغام Chrome قرار است دنبال شود.
که توزیع مهم است. تشخیص گفتار حفظ خود را در مقیاس به دست می آورد و جاسازی مدل در صفحه کلید، برنامه های دسکتاپ و مرورگرها آن را در مقابل میلیاردها تعامل ورودی روزانه قرار می دهد - در حالی که حلقه های ارزیابی لازم برای کاهش نرخ خطا در لهجه ها، گویش ها و محیط های پر سر و صدا را تامین می کند.
سهام رقابتی در هوش مصنوعی گفتار
رونویسی بی سر و صدا به یک میدان جنگ رقابتی در میان آزمایشگاه های مرزی و فروشندگان متخصص تبدیل شده است. درک گفتار دقیق و با تأخیر کم، بلیط ورودی برای محصولات نمایندگی است که بر اساس دستورات گفتاری، هوشمندی جلسات سازمانی، ویژگیهای دسترسی و اتوماسیون خدمات مشتری چند زبانه عمل میکنند.
با جفت کردن بهبودهای تأخیر تهاجمی با خروجی تصحیح خودکار، Google شرط میبندد که توسعهدهندگان رونوشتهایی را ترجیح میدهند که مانند متن ویرایش شده خوانده میشوند تا ضبط آوایی خام - وفاداری کلمه به کلمه را برای قابلیت استفاده معامله کنند. تیمهایی که به سوابق دقیق نیاز دارند، مانند رونویسکنندگان حقوقی یا پزشکی، ممکن است همچنان حالتهای کلمه به کلمه را بخواهند. برای بقیه، تفاوت عملی بین شنیدن یک نفر و درک او کماکان کم می شود.
با Gemini 3.5 Transcribe که اکنون به طور کلی در استودیوی هوش مصنوعی و ابزارهای سازمانی در دسترس است، اولین آزمایش معنیدار معیارهای پذیرش از سوی توسعهدهندگان عامل صوتی خواهد بود – بخش بازار بهقدری سریع رشد میکند که حتی افزایش دقت افزایشی به تصمیمهای تغییر قابل توجهی تبدیل میشود.
چرا تاخیر میدان جنگ واقعی است
نرخ خطا در سرفصل ها قرار می گیرد، اما تأخیر بی سر و صدا تعیین می کند که کدام محصولات قابل دوام هستند. یک موتور رونویسی که یک همپوشانی زیرنویس زنده را تغذیه میکند باید با مکالمه همگام باشد، یا بینندگان از تعامل خارج شوند. یک نماینده صوتی که در حال مذاکره با یک تماس پشتیبانی مشتری است، نمیتواند در حالی که لایه گفتارش فرا میرسد، به طرز عجیبی مکث کند. کاهش 70 درصدی تأخیر در مقایسه با Chirp 3 توسط گوگل، دقیقاً همین شکاف را هدف قرار میدهد - فاصله بین سخنران در پایان جمله و سیستمهای پاییندستی که بر اساس آن عمل میکنند را کاهش میدهد.
برای کاربردهای عاملی، این ترکیب می شود: هر نوبت گفتگوی گفتاری مستلزم تشخیص، استدلال و پاسخ است. تراشیدن میلیثانیه از مرحله تشخیص به سازندگان فرصتی برای صرف مدلهای استدلالی با توانایی بیشتر و کندتر میدهد بدون اینکه بودجه زمانبندی مکالمه را زیر پا بگذارند.
معامله واقعی
یک انتخاب طراحی مستحق بررسی است. به طور پیشفرض، Gemini 3.5 Transcribe خروجی را تنظیم میکند: کلمات پرکننده ناپدید میشوند، اشتباهات تصحیح میشوند و قالببندی بهطور خودکار اعمال میشود. برای بیشتر استفاده های تجاری - دقیقه ها، شرح ها، آرشیوهای قابل جستجو - دقیقاً همان چیزی است که کاربران می خواهند.
اما برخی گردش کارها به سوابق کلمه به کلمه بستگی دارد. سپرده های قانونی، بررسی انطباق، و بررسی حقایق روزنامه نگاری گاهی اوقات مستلزم دانستن دقیق آنچه گفته شد، از جمله تردیدها است. سازمانهای صنایع تحت نظارت میخواهند قبل از انتقال خطوط لوله حساس به مدل جدید، شفافسازی در مورد میزان هموارسازی اختیاری و قابل تنظیم باشند. اسناد و پارامترهای API Google به طور موثر جایی را تعیین می کند که خط کلمه به کلمه در مقابل صیقل برای صنعت قرار می گیرد.
رد پای چند زبانه به عنوان خندق
پوشش بیش از 85 زبان با تشخیص خودکار فقط یک آیتم چک لیست ویژگی نیست. دسترسی چند زبانه ارزش را در بازارهایی متمرکز می کند که رقبا از نظر تاریخی عقب مانده اند: لهجه های منطقه ای، تغییر کد بین زبان ها در میان جمله و زبان های کم منبع، همگی مدل هایی را که به طور محدود بر روی مجموعه های انگلیسی سنگین آموزش دیده اند مجازات می کنند.
برای شرکتهای جهانی که مراکز پشتیبانی را در دهها کشور اجرا میکنند، یک مدل واحد که تشخیص زبان را مدیریت میکند، پیچیدگی یکپارچهسازی را بهطور شفاف کاهش میدهد - یک خط لوله بهجای بسیاری از پیکربندیهای هر بازار. همراه با توزیع از طریق میلیاردها نصب اندروید Gboard، Google چند زبانه بودن با کیفیت رونویسی را بهجای یک قابلیت برتر، به عنوان زیرساخت قرار میدهد.
چه چیزی را تماشا کنیم
سه سیگنال نشان می دهد که آیا Gemini 3.5 Transcribe سهم بازار را تغییر می دهد یا صرفاً انتظارات را افزایش می دهد: مهاجرت توسعه دهندگان در معیارهای شخص ثالث در ماه های آینده. رقبا چقدر سریع با اعداد تأخیر به جای ادعاهای صحت مطابقت دارند. و اینکه آیا قلاب های فراخوانی عملکرد موجی از عوامل صدا را ایجاد می کنند که به صورت بومی بر روی Gemini ساخته شده اند. راهاندازی در حال حاضر فعال است، و سطوح قیمتگذاری از طریق AI Studio باید آزمایشها را به اندازهای ارزان کند که هزینههای تعویض تقریباً کاهش یابد.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →