Microsoft stellt Echtzeit-Transkription und mehrsprachige Sprachmodelle vor

Microsoft hat mit MAI-Transcribe-2-Streaming ein neues Modell für Live-Transkriptionen vorgestellt. Microsoft AI informiert in einem offiziellen Blogbeitrag über die neuen Modelle, zu denen auch die Sprachsynthese-Systeme MAI-Voice-2.1 und MAI-Voice-2.1-Flash gehören.

MAI-Transcribe-2-Streaming verarbeitet gesprochene Sprache nach Angaben des Unternehmens in 60 Sprachen. Es soll die verwendete Sprache zudem fortlaufend automatisch erkennen. Das Modell wartet nicht bis zum Ende eines Satzes. Stattdessen liefert es laut Microsoft etwas mehr als 100 Millisekunden nach Eingang der Audiodaten erste Textvorschläge. Diese werden angepasst, sobald weiterer Sprachkontext vorliegt.

Damit könnten Sprachassistenten schon während einer Anfrage mit der Bearbeitung beginnen. Auch für Untertitel oder Diktierfunktionen ist die schnelle Anzeige einzelner Wörter relevant. Microsoft erklärt, dass Wörter in internen Tests bei Echtzeitdiktaten und Untertiteln doppelt so schnell erschienen seien wie beim nächstbesten Wettbewerber. Bis zum Jahresende verlangt das Unternehmen zunächst 0,54 US-Dollar pro Audiostunde.

Sprachsynthese für mehrere Sprachen

MAI-Voice-2.1 erzeugt gesprochene Sprache aus Text und unterstützt 23 Sprachen sowie 26 regionale Varianten. Eine künstliche Stimme soll dabei in allen unterstützten Sprachen wiedererkennbar bleiben. Zugleich soll sie nach Darstellung von Microsoft einen jeweils passenden Akzent verwenden.

Der Preis für MAI-Voice-2.1 liegt bei 22 US-Dollar je einer Million Zeichen. Die Variante MAI-Voice-2.1-Flash richtet sich an Anwendungen mit vielen Anfragen und kurzen Reaktionszeiten. Sie kann laut Microsoft bis zu 45 Sekunden Audio mit einer Ende-zu-Ende-Latenz von 150 Millisekunden erzeugen. Der Preis beträgt 15 US-Dollar je einer Million Zeichen.

Beide Modelle erlauben das Klonen von Stimmen anhand kurzer Audioaufnahmen. Microsoft nennt außerdem eingebaute Schutzvorkehrungen zur Einwilligung. Verfügbar sind die Systeme unter anderem über Microsoft Foundry, MAI Playground und Vercel. Mit der Demo Chatter zeigt das Unternehmen, wie Transkription und Sprachausgabe in einem KI-Sprachagenten zusammenspielen können.

Bleib auf dem Laufenden

KI für Contentprofis: die neuesten Tools, Tipps und Trends. Alle 14 Tage in deine Inbox:

 

Weitere Infos …

Über den Autor

Mehr zum Thema:

×