Google startet Gemini 3.8 Flash TTS und Flash-Lite TTS für ausdrucksstarke Sprache

Google stellt mit Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS zwei Modelle für Sprachsynthese vor. Sie sollen aus Text natürlichere und besser steuerbare Sprache erzeugen und mehr als 100 Sprachen unterstützen.

Leland Rechis und Alan Cowen stellen die Modelle in einem offiziellen Google-Blogbeitrag vor. Flash TTS richtet sich an Anwendungen mit eigens gestalteten Stimmen und genauer Regie. Flash-Lite TTS soll vor allem große Mengen an Audio kostengünstig erzeugen, etwa für Synchronisationen, Audioproduktionen und Sprachassistenten.

Mit Flash TTS lassen sich Stimmen per Texteingabe beschreiben. Nutzer können laut Google Rolle, Akzent und Stimmeigenschaften festlegen. So sollen etwa Figurenstimmen oder wiedererkennbare Sprecher für Marken entstehen. Zusätzlich bietet Google mehr als 2.000 fertige Stimmen an, darunter regionale Varianten wie mexikanisches Spanisch, Quebec-Französisch und schottisches Englisch.

Mehr Kontrolle für längere Inhalte

Beide Modelle erlauben Vorgaben für einzelne Sätze. Texte können Hinweise zu Sprechtempo, Tonfall, Akzentwechseln und Reaktionen im Gespräch enthalten. Google erklärt, dass die Stimme auch über mehrere Stunden hinweg stabil bleiben soll. Das ist vor allem für Podcasts und Hörbücher relevant.

Auch Dialoge mit zwei Sprechern lassen sich aus einem einzigen Skript erzeugen. Die Stimmen sollen dabei unterscheidbar bleiben und sich natürlich abwechseln. Das kann für erzählerische Inhalte, Schulungsmaterialien und lokalisierte Medien nützlich sein.

Google ermöglicht außerdem die Nachbildung einer Stimme anhand einer 30 Sekunden langen Aufnahme. Voraussetzung ist, dass Nutzer die Rechte an der Stimme besitzen. Nach Angaben des Unternehmens prüft das System die Einwilligung über eine gesprochene Zustimmung der betreffenden Person. In Illinois, Texas, dem Europäischen Wirtschaftsraum, dem Vereinigten Königreich, der Schweiz und Indien ist diese Funktion in AI Studio nicht verfügbar.

Alle mit Gemini Audio erzeugten Dateien erhalten laut Google ein nicht hörbares SynthID-Wasserzeichen. Entwickler können beide Modelle über die Gemini API und Google AI Studio nutzen. Flash TTS wird zudem in Gemini Notebook eingeführt, Flash-Lite TTS in Google Vids.

Bleib auf dem Laufenden

KI für Contentprofis: die neuesten Tools, Tipps und Trends. Alle 14 Tage in deine Inbox:

 

Weitere Infos …

Über den Autor

Mehr zum Thema:

×