Google Gemini 3.5 Transcript را راه‌اندازی کرده است، یک مدل گفتار به نوشتار جدید که برای رونویسی بی‌درنگ ساخته شده است که بیش از ۸۵ زبان را به‌طور خودکار تشخیص می‌دهد - و خروجی را در طول مسیر صیقل می‌دهد، کلمات پرکننده را حذف می‌کند و اشتباهات کلامی را بدون درخواست تصحیح می‌کند.

این راه‌اندازی، پشته گفتار Google را به‌عنوان یک چالش مستقیم در بازار رونویسی رو به رشد قرار می‌دهد، جایی که دقت و تأخیر به طور فزاینده‌ای تصمیم می‌گیرد که توسعه‌دهندگان کدام سرویس‌ها را برای تماس‌ها، جلسات، شرح‌ها و رابط‌های صوتی اتخاذ کنند. For more context on this story, see our ongoing latest AI developments.

آنچه مدل می تواند انجام دهد

بر اساس اعلامیه گوگل که پوشش آن توسط The Decoder منتشر شده است، Gemini 3.5 Transcribe فراتر از تبدیل کلمات گفتاری به متن است:

  • تشخیص خودکار زبان در بیش از 85 زبان، بدون نیاز به پیکربندی
  • حذف کلمه پرکننده، پاکسازی "اوم"، "اوه" و ناهماهنگی های مشابه
  • اصلاح لغزش های زبان، تولید نثر خواندنی به جای صدای لفظی
  • قالب بندی خودکار متن ، از جمله نقطه گذاری و ساختار

این شرکت نرخ خطای کلمه 4.0 درصد برای پخش صدا و 2.6 درصد برای صدای ضبط شده، در کنار کاهش تأخیر تقریباً 70 درصدی در مقایسه با نسخه قبلی خود Chirp 3 گزارش می کند - یک حاشیه قابل توجه در سناریوهای زیرنویس زنده که در آن تأخیر مکالمات را قطع می کند.

دو رابط برای دو کار

توسعه دهندگان از طریق دو رابط برنامه نویسی کاربردی مجزا دسترسی پیدا می کنند:

Live API — «gemini-3.5-transscribe-live».

پخش هم‌زمان را با تأخیر بسیار کم انجام می‌دهد، زیرنویس‌های زنده، عوامل صوتی و دستیارهای تعاملی را هدف قرار می‌دهد، جایی که زمان پاسخ‌دهی بیشترین اهمیت را دارد.

Interactions API — «gemini-3.5-transscribe».

صداهای ضبط شده را پردازش می‌کند و رونوشت‌ها را با ذکر منبع سخنران و مُهرهای زمانی برمی‌گرداند - جریان کاری معمول برای جلسات، مصاحبه‌ها، پادکست‌ها و پس از تولید رسانه‌ها.

فراتر از رونویسی، این مدل از تعداد فراخوانی پشتیبانی می‌کند، به این معنی که می‌تواند وظایف بعدی را به مدل‌های دیگر خانواده Gemini محول کند - به عنوان مثال، درخواست تولید تصویر یا جستجوی وب را بر اساس چیزی که در طول یک جلسه گفته شده است، راه‌اندازی کند. این یک موتور رونوشت را به یک لایه رابط قابل کنترل برای برنامه های کاربردی صوتی تبدیل می کند.

از قبل در سراسر محصولات Google ارسال شده است

این مدل امروز در Google AI Studio و در پلتفرم عامل سازمانی Gemini برای توسعه دهندگان به صورت زنده ارائه می شود. Google همچنین آن را به سطوح مصرف‌کننده متصل کرده است: Gboard در Android از آن از طریق یک مؤلفه داخلی به نام Rambler برای دیکته استفاده می‌کند، برنامه Gemini در macOS آن را برای ورودی صوتی اعمال می‌کند، و ادغام Chrome قرار است دنبال شود.

که توزیع مهم است. تشخیص گفتار حفظ خود را در مقیاس به دست می آورد و جاسازی مدل در صفحه کلید، برنامه های دسکتاپ و مرورگرها آن را در مقابل میلیاردها تعامل ورودی روزانه قرار می دهد - در حالی که حلقه های ارزیابی لازم برای کاهش نرخ خطا در لهجه ها، گویش ها و محیط های پر سر و صدا را تامین می کند.

سهام رقابتی در هوش مصنوعی گفتار

رونویسی بی سر و صدا به یک میدان جنگ رقابتی در میان آزمایشگاه های مرزی و فروشندگان متخصص تبدیل شده است. درک گفتار دقیق و با تأخیر کم، بلیط ورودی برای محصولات نمایندگی است که بر اساس دستورات گفتاری، هوشمندی جلسات سازمانی، ویژگی‌های دسترسی و اتوماسیون خدمات مشتری چند زبانه عمل می‌کنند.

با جفت کردن بهبودهای تأخیر تهاجمی با خروجی تصحیح خودکار، Google شرط می‌بندد که توسعه‌دهندگان رونوشت‌هایی را ترجیح می‌دهند که مانند متن ویرایش شده خوانده می‌شوند تا ضبط آوایی خام - وفاداری کلمه به کلمه را برای قابلیت استفاده معامله کنند. تیم‌هایی که به سوابق دقیق نیاز دارند، مانند رونویس‌کنندگان حقوقی یا پزشکی، ممکن است همچنان حالت‌های کلمه به کلمه را بخواهند. برای بقیه، تفاوت عملی بین شنیدن یک نفر و درک او کماکان کم می شود.

با Gemini 3.5 Transcribe که اکنون به طور کلی در استودیوی هوش مصنوعی و ابزارهای سازمانی در دسترس است، اولین آزمایش معنی‌دار معیارهای پذیرش از سوی توسعه‌دهندگان عامل صوتی خواهد بود – بخش بازار به‌قدری سریع رشد می‌کند که حتی افزایش دقت افزایشی به تصمیم‌های تغییر قابل توجهی تبدیل می‌شود.

چرا تاخیر میدان جنگ واقعی است

نرخ خطا در سرفصل ها قرار می گیرد، اما تأخیر بی سر و صدا تعیین می کند که کدام محصولات قابل دوام هستند. یک موتور رونویسی که یک همپوشانی زیرنویس زنده را تغذیه می‌کند باید با مکالمه همگام باشد، یا بینندگان از تعامل خارج شوند. یک نماینده صوتی که در حال مذاکره با یک تماس پشتیبانی مشتری است، نمی‌تواند در حالی که لایه گفتارش فرا می‌رسد، به طرز عجیبی مکث کند. کاهش 70 درصدی تأخیر در مقایسه با Chirp 3 توسط گوگل، دقیقاً همین شکاف را هدف قرار می‌دهد - فاصله بین سخنران در پایان جمله و سیستم‌های پایین‌دستی که بر اساس آن عمل می‌کنند را کاهش می‌دهد.

برای کاربردهای عاملی، این ترکیب می شود: هر نوبت گفتگوی گفتاری مستلزم تشخیص، استدلال و پاسخ است. تراشیدن میلی‌ثانیه از مرحله تشخیص به سازندگان فرصتی برای صرف مدل‌های استدلالی با توانایی بیشتر و کندتر می‌دهد بدون اینکه بودجه زمان‌بندی مکالمه را زیر پا بگذارند.

معامله واقعی

یک انتخاب طراحی مستحق بررسی است. به طور پیش‌فرض، Gemini 3.5 Transcribe خروجی را تنظیم می‌کند: کلمات پرکننده ناپدید می‌شوند، اشتباهات تصحیح می‌شوند و قالب‌بندی به‌طور خودکار اعمال می‌شود. برای بیشتر استفاده های تجاری - دقیقه ها، شرح ها، آرشیوهای قابل جستجو - دقیقاً همان چیزی است که کاربران می خواهند.

اما برخی گردش کارها به سوابق کلمه به کلمه بستگی دارد. سپرده های قانونی، بررسی انطباق، و بررسی حقایق روزنامه نگاری گاهی اوقات مستلزم دانستن دقیق آنچه گفته شد، از جمله تردیدها است. سازمان‌های صنایع تحت نظارت می‌خواهند قبل از انتقال خطوط لوله حساس به مدل جدید، شفاف‌سازی در مورد میزان هموارسازی اختیاری و قابل تنظیم باشند. اسناد و پارامترهای API Google به طور موثر جایی را تعیین می کند که خط کلمه به کلمه در مقابل صیقل برای صنعت قرار می گیرد.

رد پای چند زبانه به عنوان خندق

پوشش بیش از 85 زبان با تشخیص خودکار فقط یک آیتم چک لیست ویژگی نیست. دسترسی چند زبانه ارزش را در بازارهایی متمرکز می کند که رقبا از نظر تاریخی عقب مانده اند: لهجه های منطقه ای، تغییر کد بین زبان ها در میان جمله و زبان های کم منبع، همگی مدل هایی را که به طور محدود بر روی مجموعه های انگلیسی سنگین آموزش دیده اند مجازات می کنند.

برای شرکت‌های جهانی که مراکز پشتیبانی را در ده‌ها کشور اجرا می‌کنند، یک مدل واحد که تشخیص زبان را مدیریت می‌کند، پیچیدگی یکپارچه‌سازی را به‌طور شفاف کاهش می‌دهد - یک خط لوله به‌جای بسیاری از پیکربندی‌های هر بازار. همراه با توزیع از طریق میلیاردها نصب اندروید Gboard، Google چند زبانه بودن با کیفیت رونویسی را به‌جای یک قابلیت برتر، به عنوان زیرساخت قرار می‌دهد.

چه چیزی را تماشا کنیم

سه سیگنال نشان می دهد که آیا Gemini 3.5 Transcribe سهم بازار را تغییر می دهد یا صرفاً انتظارات را افزایش می دهد: مهاجرت توسعه دهندگان در معیارهای شخص ثالث در ماه های آینده. رقبا چقدر سریع با اعداد تأخیر به جای ادعاهای صحت مطابقت دارند. و اینکه آیا قلاب های فراخوانی عملکرد موجی از عوامل صدا را ایجاد می کنند که به صورت بومی بر روی Gemini ساخته شده اند. راه‌اندازی در حال حاضر فعال است، و سطوح قیمت‌گذاری از طریق AI Studio باید آزمایش‌ها را به اندازه‌ای ارزان کند که هزینه‌های تعویض تقریباً کاهش یابد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →