Google stellt mit Gemini 3.5 Transcribe ein neues Modell für die Umwandlung von Sprache in Text vor. Es richtet sich an Anwendungen für Live-Gespräche, Meeting-Aufzeichnungen und sprachgesteuerte Arbeitsabläufe. Nach Angaben des Unternehmens verarbeitet das Modell auch Hintergrundgeräusche, Fachbegriffe, Akzente und Selbstkorrekturen besser als herkömmliche Spracherkennung.
Für Entwickler gibt es zwei Schnittstellen. gemini-3.5-transcribe-live arbeitet über die Live API und liefert fortlaufende Transkripte mit einer Verzögerung von unter einer Sekunde. Das Modell gemini-3.5-transcribe verarbeitet Aufnahmen über die Interactions API. Es kann dabei Zeitstempel für einzelne Wörter setzen und Sprecher zuordnen.
Das Modell soll Füllwörter wie „äh“ entfernen, Satzzeichen und Formatierungen ergänzen sowie nachträgliche Änderungen beim Sprechen erkennen. Sagt jemand zunächst einen Termin für Dienstag und korrigiert ihn auf Mittwoch, soll im Ergebnis nur die gültige Angabe erscheinen. Eigene Wortlisten helfen zudem bei Produktnamen, internen Abkürzungen oder branchenspezifischen Begriffen.
Mehrsprachig und für mehrere Sprecher
Google zufolge erkennt Gemini 3.5 Transcribe mehr als 85 Sprachen automatisch. Bei aufgezeichnetem Material kann das System bis zu drei Sprecher mit Zeitangaben unterscheiden. Die Unterstützung für mehr Sprecher befindet sich noch im Versuchsstadium.
Google verweist auf Messungen von Artificial Analysis. Demnach liegt die durchschnittliche Word Error Rate bei 4,0 Prozent für Streaming und bei 2,6 Prozent für nicht laufende Verarbeitung. Gegenüber dem Vorgängermodell Chirp 3 soll die Zeit bis zum fertigen Transkript um 70 Prozent sinken. Dabei handelt es sich um von Google angeführte Vergleichswerte.
Die Technik kommt bereits in der Gemini-App für macOS und in der Android-Tastaturfunktion Rambler zum Einsatz. In der macOS-App kann sie weitere Gemini-Modelle für Aufgaben wie Dateianalyse oder Bilderzeugung aufrufen. Auch Chrome soll künftig Spracheingabe in jedem Webformular erhalten.
Die Angebote für Entwickler und Unternehmen stehen über Google AI Studio, Google Antigravity und die Gemini Enterprise Agent Platform als öffentliche Vorschau bereit.
Quellen
- Intelligent transcription with Gemini 3.5 Transcribe – Google
- Google debuts Gemini 3.5 Transcribe, a speech-to-text model that powers Gboard Rambler and is coming to Chrome, in public preview for developers and enterprises – 9to5Google
Bleib auf dem Laufenden
KI für Contentprofis: die neuesten Tools, Tipps und Trends. Alle 14 Tage in deine Inbox: