Google hat am Mittwoch zwei neue Text-to-Speech-Modelle vorgestellt – Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS – und bezeichnet sie als seine bisher ausdrucksstärksten Modelle zur Audioerzeugung. Die Modelle sind in Google AI Studio, der Gemini API, Gemini Enterprise, Gemini Notebook und Google Vids verfügbar, so die Ankündigung von Google durch Leland Rechis, Group Product Manager, und Alan Cowen, Director of Research Science im Gemini Audio Team.
Die Einführung verschiebt die Spracherzeugung über statische Sprachvoreinstellungen hinaus in das, was Google als Kreativstudio beschreibt: Stimmen, die auf der Grundlage einer Textaufforderung erstellt werden, zeilenweise gesteuerte Darbietungen und von Anfang an eingebaute Sicherheitsgerüste. Weitere Informationen zu dieser und anderen Veröffentlichungen finden Sie in unseren KI-Modell-Neuigkeiten.
Zwei Models, zwei Jobs
Das Paar teilt die Arbeitslast in gewohnter Google-Manier auf. Gemini 3.8 Flash TTS ist für tiefgreifende kreative Leitung und Charakterdesign konzipiert – die Erstellung völlig neuer Stimmen von Grund auf über Ansagen in natürlicher Sprache für Spiele, immersive Hörbücher, Podcasts und interaktive Medien, mit detaillierter Kontrolle über Schauspielhinweise, Tempo, Dialektwechsel und Rückkanalisierung. Gemini 3.8 Flash-Lite TTS ist das Volumenspiel: optimiert für die Synchronisierung mit hoher Lautstärke, die Erstellung von Audioinhalten und ausdrucksstarke Sprachagenten in großem Maßstab, mit feinkörniger Kontrolle über Ton, Tempo und Nuancen zu geringeren Kosten.
Die Positionierung von Google beschreibt das Paar als eine Transformation der Spracherzeugung „von statischen Voreinstellungen in ein dynamisches Kreativstudio“. Das Unternehmen nennt Hörbücher, Spiele und Podcasts als natürliche Ziele für das Flaggschiff-Modell, während die Lite-Variante auf den unscheinbaren, aber riesigen Markt für Synchronisation und ständig verfügbare Sprachagenten abzielt, bei dem die Kosten pro generierter Minute wichtiger sind als die Starleistung. Beide Modelle sind in Google-Produkte integriert – darunter Gemini Notebook und Google Vids –, was darauf hindeutet, dass die Technologie in verbraucherorientierten Tools zum Einsatz kommen wird und kein reines API-Spiel bleiben wird.
Ein komplettes Gesangsstudio, von 30 Stimmen bis unendlich
Laut Google können Entwickler jetzt von 30 Originalstimmen auf eine sogenannte unendliche Bibliothek skalieren. Mit dem generativen Sprachdesignsystem können Benutzer maßgeschneiderte Stimmen erstellen, indem sie Rollen-, Akzent- und Stimmmerkmale in mehr als 100 Sprachen und Dialekten festlegen – die Demos von Google reichen von einer energiegeladenen DJ-Stimme aus Melbourne bis zu einem „superblechernen, monotonen Roboter“ und einem japanischen Drachen.
Neben der Generierung verfügen die Modelle über eine Bibliothek mit mehr als 2.000 produktionsbereiten Stimmen, darunter regionale Varianten wie mexikanisches Spanisch, Quebec-Französisch und schottisches Englisch.
Die Sprachreplikation ist in Leitplanken enthalten: Benutzer können ein konsistentes Stimmprofil aus nur 30 Sekunden Audioprobe wiederherstellen – ihrer eigenen Stimme oder einer Stimme, zu deren Verwendung sie berechtigt sind – unterstützt durch integrierte Einwilligungsüberprüfung, SynthID-Wasserzeichen und C2PA-Anmeldeinformationen. Google fügt außerdem eine Funktion zum Speichern und Skalieren hinzu, um benutzerdefinierte Stimmen projektübergreifend konsistent zu halten. Sprach-Remixing – Feinabstimmung von Klangfarbe, Tonhöhe, Tempo und Akzent über Eingabeaufforderungen – wird in Kürze verfügbar sein.
Die Aufführung Zeile für Zeile steuern
Beide Modelle unterstützen eine präzise Richtung pro Zeile. Entwickler können ihre eigenen Regieanweisungen schreiben oder das Model die Darbietung anhand natürlicher Drehbuch-Hinweise steuern lassen – der Unterschied zwischen einem ruhigen Kundendienstmitarbeiter und einer geflüsterten Spannungsszene. Geskriptete Stimmausbrüche wie
Zwei Funktionen zielen auf längere und mehrstimmige Arbeiten ab. Die Langformatgenerierung behält die Sprachqualität und das Tempo über stundenlanges kontinuierliches Audio mit minimaler Sprecherdrift bei – speziell für Podcasts und Hörbücher –, während die native Szeneninszenierung mit zwei Sprechern Gespräche mit mehreren Gesprächen aus einem einzigen Skript mit natürlichem Abwechseln und klar getrennten Stimmen leitet.
Benchmarks: Nr. 1 bei Hume AI
Google führt die Ankündigung mit Zahlen von Drittanbietern an. Gemini 3.8 Flash TTS belegte mit einer Punktzahl von 71,4 den ersten Platz im Voice Design Benchmark von Hume AI und führt bei der Akzentmodellierung mit 60,8. Im Overall Quality Index von Hume AI belegen die beiden neuen Modelle die Plätze 1 und 2.
Benchmark-Behauptungen des Anbieters sollten immer mit einiger Vorsicht gelesen werden, aber Hume AI – ein unabhängiges Sprach-KI-Forschungsunternehmen – ist ein guter Gutachter für Sprachqualität, und die Ergebnisse geben Google ein konkretes Argument gegen Konkurrenten in der Spracherzeugung.
Das Audio-Wettrüsten geht weiter
Die neuen Modelle ergänzen eine schnell wachsende Gemini-Audiofamilie, die bereits 3.5 Live Translate, 3.5 Transcribe, 3.8 Live und 3.8 Live Extended Thinking umfasst – die Echtzeit-Sprachmodelle, die Google Anfang dieses Monats eingeführt hat. Der Rhythmus kommt nicht von ungefähr: Ausdrucksstarke, zuverlässige Sprachsynthese wird zur Kerninfrastruktur für Sprachagenten, Kundensupport, Barrierefreiheitstools und Medienproduktion, und Google möchte, dass Gemini die Standardebene für all das ist.
Für Entwickler ist die unmittelbare Erkenntnis eher praktisch als futuristisch: Benutzerdefinierte Markenstimmen, mehrsprachige Synchronisation und stundenlange Erzählung sind jetzt in der Gemini-API und im AI Studio nur noch eine Eingabeaufforderung verfügbar – mit angehängten Wasserzeichen.
Die Ökonomie wird darüber entscheiden, wie viel von diesem Potenzial genutzt wird. Google hat in den Einführungsmaterialien keinen Schwerpunkt auf die Preisgestaltung gelegt, aber die Existenz einer Flash-Lite-Stufe impliziert eine bewusst kostengünstige Option für Massenarbeitslasten und spiegelt die Staffelungsstrategie wider, die es in der gesamten Gemini-Modellfamilie anwendet. Unternehmen, die Gemini Enterprise nutzen, erhalten die gleichen Funktionen wie ihre bestehenden Vereinbarungen, und Google geht davon aus, dass dort der Großteil der hochvolumigen Audioproduktion landen wird.
Es bleibt abzuwarten, wie schnell die Kreativwirtschaft synthetische Erzählungen übernimmt. Wasserzeichen und Einwilligungsüberprüfung senken die rechtlichen und ethischen Hürden, und die Benchmark-Zahlen deuten darauf hin, dass Qualität nicht länger der Engpass ist. Wenn Googles Behauptungen in der Praxis Bestand haben, ist die Lücke zwischen einem aufgezeichneten und einem generierten Voice-Over inzwischen so gering, dass bei den meisten Projekten Kosten und Umsetzung – und nicht die Authentizität – ausschlaggebend sind.
---
Der KI einen Schritt voraus seinErhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Weitere KI-Neuigkeiten lesen →