גוגל שלחה בשקט שני עדכוני דגמי ג'מיני משמעותיים תוך 48 שעות השבוע, ושניהם מכוונים באופן ישיר למפתחים שבונים יישומי ייצור. Gemini 3.5 Transcribe, שהוצג ב-26 באוגוסט, הוא מודל הדיבור לטקסט המדויק ביותר של החברה עד כה, לפי הבלוג הרשמי של גוגל. Gemini Omni 1.1 Flash, שהוכרז ב-27 באוגוסט, מביא בקרות ברמה מקצועית לווידאו יצירתי, כולל הארכת סצנה של עד 40 שניות והגדלת קנה מידה 4K. שני הדגמים זמינים דרך ה-API של Gemini ב-Google AI Studio ו-Gemini Enterprise Agent Platform.

Gemini 3.5 תמלול: דיבור לטקסט שמנקה אחרי עצמו For more context on this story, see our ongoing more AI stories.

מה שמבדיל את Gemini 3.5 Transcribe מזיהוי דיבור קונבנציונלי, אומרת גוגל, הוא שהוא ממיר אודיו גולמי ישירות לטקסט מלוטש ומעוצב במקום לתמלול גולמי. הדגם מתמודד עם רעשי רקע, ז'רגון מורכב וניקוי חוסר שטף באופן מקורי - הוא מסיר מילות מילוי כמו "אממ" ו"אהה", פותר תיקונים עצמיים כגון "בוא ניפגש ביום שלישי - לא, רביעי" ומעצב אוטומטית את הפלט.

מספרי ההשוואה שגוגל ציטטה בולטים. כפי שנמדד על ידי ניתוח מלאכותי, המודל משיג שיעור שגיאות מילים ממוצע (WER) של 4.0 אחוזים עבור מקרי שימוש בסטרימינג ו-2.6 אחוזים עבור אודיו שאינו זורם. במבחן הרב-לשוני של FLEURS בשפות המובילות, הוא מפרסם WER של 5.50 אחוז במצב סטרימינג ו-5.04 אחוז ללא סטרימינג, שיפור במודל התמלול הקודם של גוגל, Chirp 3. הזמן עד לתמלול הסופי משתפר ב-70 אחוז בהשוואה ל-Chirp 3, שוב כפי שנמדד על ידי ניתוח מלאכותי.

הדגם נשלח בשתי גרסאות עבור שני זרימות עבודה. עבור יישומים חיים, `gemini-3.5-transcribe-live` מספק סטרימינג דו-כיווני רציף עם זמן השהייה של תת-שנייה דרך ממשק ה-API של Live, מיקוד לסוכני קול וכתוביות בזמן אמת. עבור אודיו מוקלט - פגישות, יומני שיחות, ארכיונים - 'gemini-3.5-transcribe' מציע ייחוס דוברים לעד שלושה דוברים (עם תמיכה בעוד במצב ניסיוני) וחותמות זמן ברמת המילה באמצעות ה-Interactions API.

יכולות אחרות כוללות זיהוי ותעתוק אוטומטיים על פני יותר מ-85 שפות עם טיפול במבטא ובדיאלקט, ותמיכה באוצר מילים מותאם אישית כך שהמודל מסתגל לז'רגון מיוחד ואיותים ייחודיים. גוגל גם נתנה לדגם עיניים מסוג מסוים: באמצעות קריאת פונקציות, היא יכולה להאציל משימות כמו יצירת תמונות או ניתוח קבצים לדגמי Gemini אחרים - תכונה הזמינה כעת באפליקציית Gemini ב-macOS.

Gemini Omni 1.1 פלאש: יצירת וידאו מגדילה ציר זמן

ההשקה השנייה מתייחסת לתלונה הנפוצה ביותר על וידאו בינה מלאכותית: שליטה. Gemini Omni 1.1 Flash הוא עדכון ממוקד ייצור שהופך את הווידיאו הגנרטיבי לניוט בדרכים שקודמיו לא היו, כאשר מנהלי המוצר של Google DeepMind Anish Nangia ו-Alisa Fortin מתארים את המהדורה כמי שהופך את Omni 1.1 ל"מוכן לייצור לשימוש מקצועי".

הרחבת סצנה היא תכונת הכותרת. מפתחים יכולים כעת להמשיך להפיק קטעים בצורה חלקה מקליפ קיים, כאשר המודל מנתח עד 10 שניות של הקשר קודם - קפיצה מדגמים קודמים שהתייחסו רק לשניה האחרונה. ניתן להאריך סרטונים במרווחים של 10 שניות עד לאורך מצטבר של 40 שניות, לשפר את העקביות החזותית והדבקות הסיפורית לסיפורים ארוכים יותר.

העדכון מוסיף גם אינטרפולציה של פריים ראשון ואחרון, ומאפשר למפתחים לציין פריימים התחלה וסיום כדי ליצור תנועות מצלמה חלקות ומכוונות ומעברים בין צילומים. לצורך מסירה, ניתן להגדיל פרויקטים שהסתיימו לרזולוציית 4K, בעוד שמצב תצוגה מקדימה של 360p מאפשר ליוצרים לחזור על הנחיות במהירות ובזול לפני שהם מתחייבים לעיבוד סופי.

מ-API למשטחים יומיומיים

גוגל גם מחברת את שני הדגמים למוצרי הצריכה שלה, שם ניכר יתרון ההפצה שלה. באנדרואיד, התכונה החדשה "Rambler" ב-Gboard משתמשת ב-3.5 תמלול כדי להפוך מחשבות מדוברות לטקסט מעוצב היטב תוך סינון מילות מילוי - משתמשים יכולים אפילו לבצע עריכות בקול. הדגם גם מפעיל הכתבה באפליקציית Gemini ב-macOS, פועל לצד ההקשר של המסך ב-Google Antigravity, ומשולב בכרום.

עבור מפתחים, שתי ההשקות נקראות כאסטרטגיה אחת: גוגל דוחפת את ג'מיני מצ'אטבוט שאתה מדבר איתו לתשתית שרואה, שומעת ומייצרת מדיה. עם OpenAI, ElevenLabs וקבוצת סטארט-אפים של וידאו שמתחרים באותה טריטוריה, שיעור שגיאות המילים של 2.6 אחוז וסצנות קוהרנטיות של 40 שניות הם הצעת הפתיחה של גוגל לעומסי העבודה של הייצור שיוצרים בפועל הכנסות - סוכנים קוליים, צינורות כתוביות וכלים יצירתיים. מפתחים יכולים להתחיל לבנות עם שני הדגמים ב-Google AI Studio היום.

מדוע שיעור שגיאות המילים עדיין חשוב

שיעור שגיאות מילים נשמע כמו נתון אקדמי, אבל בהפקה זה ההבדל בין מוצר קולי שעובד לכזה שמתסכל. כל אמירה לא מובנת בסוכן קולי שוברת משימה: מזהה הזמנה שלא נשמע לא נכון מפעיל חיפוש כושל, כתובת משובשת שולחת חבילה לעיר הלא נכונה. זו הסיבה שהפער בין WER של 2.6 אחוז באודיו שאינו זורם לבין הקצבים החד-ספרתיים הגבוהים שהיו נפוצים לפני דור של דגמים מתחברים להפרש בסדר גודל בשימושיות.

ההבחנה בין שני המצבים שגוגל דיווחה חשובה גם לאדריכלים. תמלול סטרימינג - נתון WER של 4.0 אחוז - מחליף דיוק מסוים עבור זמן אחזור של תת-שנייה, אשר מקרי שימוש אינטראקטיביים כמו סוכני קול חיים דורשים. תמלול אצווה של אודיו מוקלט פועל לאט יותר אך מגיע ל-2.6 אחוז, וזו הסיבה שניתוח שלאחר שיחות ועיבוד ארכיון יכולים להרשות לעצמם להיות תובעניים יותר. ההחלטה של ​​גוגל לחשוף את שניהם כנקודות קצה נפרדות של מודל ולא כהגדרה אחת מתכווננת מכירה בכך שמפתחים בונים מוצרים שונים משני הצדדים של הפשרה הזו.

זרימת עבודה מדורגת להפקת וידאו

עדכון Omni 1.1 Flash הוא פרגמטי באותה מידה לגבי האופן שבו עבודה יצירתית מתרחשת בפועל. סרטון יצירתי היה יקר לחזור איתו: כל ניסוי מיד פירושו עיבוד מלא. מצב התצוגה המקדימה החדש של 360p מפריד בין חקירה למסירה, ומאפשר ליוצרים לעבור בין וריאציות מיידיות בזול ולשלם רק עבור הגדלה של 4K בצילומים ששרדו את הסקירה.

מכניקת הרחבת הסצנה מטפלת בבעיית הקוהרנטיות שהחזיקה את סרטון הבינה המלאכותית בגטו בגודל קליפ. על ידי ניתוח של 10 שניות של הקשר קודם במקום רק הפריים הסופי, המודל יכול להאריך סצנה במרווחים של 10 שניות עד 40 שניות תוך שמירה על עקביות של תווים, תאורה וסגנון חזותי. בשילוב עם אינטרפולציה של פריים ראשון ואחרון - המעניק לעורכים נקודות בקרה דטרמיניסטיות, הדרך שבה סמני כניסה ויציאה פועלים בעריכה קונבנציונלית - קטעי AI שנוצרו מתחילים להשתלב בצינורות שלאחר הייצור האמיתיים במקום להחליף אותם בסיטונאות.

התמונה התחרותית

שתי ההשקות מציבות את גוגל כתשתית ולא כיעד. בדיבור, גוגל לוקחת על עצמה ספקי תמלול מיוחדים ואת ערימות הקול של מתחרותיה בענן על ידי שילוב דיוק מתקדם ב-Gemini API שהמפתחים שלה כבר משתמשים בה. בווידאו, היא מתחרה בשוק עמוס בסטארטאפים ממומנים היטב על ידי שימת דגש על שליטה ושילוב זרימת עבודה על פני מחזה גולמי.

יתרון ההפצה עשוי להיות הגורם המכריע. אותו מודל תמלול שמפתחים יכולים להתקשר אליו מממשק ה-API של Gemini כבר מפעיל את הכתבה Rambler של Gboard באנדרואיד, את אפליקציית Gemini ב-macOS, Google Antigravity וכרום - כלומר גוגל יכולה להפחית את פיתוח המודל על פני מיליארדי אינטראקציות של משתמשים תוך איסוף האודיו המגוון בעולם האמיתי שממשיך לשפר אותו. עבור מפתחים שבוחרים בערימת דיבור או וידאו בשנת 2026, גלגל התנופה הזה הוא כעת חלק מהמגרש.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →