Microsoft stellt Echtzeit-Transkription und mehrsprachige Sprachmodelle vor

Microsoft hat mit MAI-Transcribe-2-Streaming ein neues Modell für Live-Transkriptionen vorgestellt. Microsoft AI informiert in einem offiziellen Blogbeitrag über die neuen Modelle, zu denen auch die Sprachsynthese-Systeme MAI-Voice-2.1 und MAI-Voice-2.1-Flash gehören. MAI-Transcribe-2-Streaming verarbeitet gesprochene Sprache nach Angaben des Unternehmens in 60 Sprachen. Es soll die verwendete Sprache zudem fortlaufend automatisch erkennen. Das Modell wartet nicht bis …

Weiterlesen …

Suno Speech: KI-Stimmen mit optionaler Musik

Suno stellt mit Speech eine öffentliche Beta für KI-generierte Sprachaufnahmen vor. Das Werkzeug erstellt gesprochene Inhalte aus Eingaben oder fertigen Skripten und kann passende Hintergrundmusik direkt hinzufügen. Jess Weatherbed berichtet für The Verge, dass Speech im Web und in den mobilen Apps von Suno verfügbar ist. Damit erweitert das Unternehmen sein Angebot über die bisherige …

Weiterlesen …

Google startet Gemini 3.8 Flash TTS und Flash-Lite TTS für ausdrucksstarke Sprache

Google stellt mit Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS zwei Modelle für Sprachsynthese vor. Sie sollen aus Text natürlichere und besser steuerbare Sprache erzeugen und mehr als 100 Sprachen unterstützen. Leland Rechis und Alan Cowen stellen die Modelle in einem offiziellen Google-Blogbeitrag vor. Flash TTS richtet sich an Anwendungen mit eigens gestalteten …

Weiterlesen …

Google stellt Gemini 3.8 Live für Sprachassistenten vor

Google bringt mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei neue KI-Modelle für gesprochene Gespräche, Sprachassistenten und Aufgaben mit Bildverständnis und Werkzeugaufrufen auf den Markt. Tom Ouyang und Malini Jaganathan stellen die Modelle im offiziellen Blog von Google vor. Gemini 3.8 Live richtet sich laut Google an Anwendungen, die viele Gespräche effizient …

Weiterlesen …

Gemini 3.5 Transcribe von Google soll aus gesprochener Sprache sauberen Text machen

Google stellt mit Gemini 3.5 Transcribe ein neues Modell für die Umwandlung von Sprache in Text vor. Es richtet sich an Anwendungen für Live-Gespräche, Meeting-Aufzeichnungen und sprachgesteuerte Arbeitsabläufe. Nach Angaben des Unternehmens verarbeitet das Modell auch Hintergrundgeräusche, Fachbegriffe, Akzente und Selbstkorrekturen besser als herkömmliche Spracherkennung. Für Entwickler gibt es zwei Schnittstellen. gemini-3.5-transcribe-live arbeitet über die …

Weiterlesen …

Palmier Pro lässt Claude und Codex Routinearbeit im Videoschnitt übernehmen

Palmier Pro ist ein neues Open-Source-Schnittprogramm für macOS. Es verbindet eine klassische Zeitleiste mit KI-Generierung und Schnittstellen für KI-Agenten. Mitgründer Harrison Tin stellt das Projekt in einem Show-HN-Beitrag auf Hacker News vor. Das Ziel sei, wiederkehrende Arbeit in der Videoproduktion zu verringern, nicht kreative Entscheidungen von Menschen zu ersetzen. In der Anwendung lassen sich Bilder, …

Weiterlesen …

GPT-Live: OpenAI ersetzt Advanced Voice Mode durch Full-Duplex-Technik

OpenAI hat mit GPT-Live eine neue Generation von Audio-Sprachmodellen vorgestellt. Sie soll Gespräche mit ChatGPT natürlicher wirken lassen. Das Unternehmen kündigt in einem offiziellen Blogbeitrag an, dass GPT-Live den bisherigen Advanced Voice Mode ablöst. Der Rollout startet weltweit auf iOS, Android und ChatGPT.com. Kern der Neuerung ist eine sogenannte Full-Duplex-Architektur. Frühere Systeme warteten stets, bis …

Weiterlesen …

Apple erweitert Creator Studio mit KI-Funktionen für Video-, Bild- und Audiobearbeitung

Apple hat seine Creator-Studio-Apps mit einer Reihe neuer KI-Funktionen aktualisiert. Sie umfassen Pixelmator Pro, Final Cut Pro, Logic Pro und weitere Programme. Juli Clover berichtet für MacRumors über Updates in den Bereichen Videobearbeitung, Bildgenerierung, Audioproduktion und Dokumentenbearbeitung. Final Cut Pro erhält zwei besonders relevante KI-Neuerungen für die Videoarbeit. Generate Captions erstellt automatisch Untertitel aus dem …

Weiterlesen …

KI-Musikplattform Suno erhält 400 Millionen Dollar bei einer Bewertung von 5,4 Milliarden Dollar

Die KI-Musikplattform Suno hat eine Finanzierungsrunde über 400 Millionen Dollar abgeschlossen. Das Unternehmen wird dabei mit 5,4 Milliarden Dollar bewertet. Corbin Bolies berichtet für Variety, dass die Series-D-Runde von Bond Capital angeführt wurde. Ebenfalls beteiligt sind IVP, Forerunner, Union Square Ventures, Alkeon Capital Management und Quiet. Auch frühere Investoren wie Matrix, Lightspeed, Menlo Ventures und …

Weiterlesen …

Dubbing v2: ElevenLabs bringt KI-Synchronisation auf ein neues Niveau

Das KI-Unternehmen ElevenLabs hat Dubbing v2 veröffentlicht, ein neues Modell zur automatischen Videosynchronisation. Imogen Mulliner und Jakub Lichman schreiben bei ElevenLabs, dass das System direkt auf die originale Sprachaufnahme zugreift, statt sich auf ein Transkript zu stützen. So sollen Tonlage, Tempo und emotionaler Ausdruck des Sprechers in mehr als 90 Sprachen übertragen werden. Bisherige KI-Synchronisationstools …

Weiterlesen …

×