Google startet Gemini 3.8 Flash TTS und Flash-Lite TTS für ausdrucksstarke Sprache

Google stellt mit Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS zwei Modelle für Sprachsynthese vor. Sie sollen aus Text natürlichere und besser steuerbare Sprache erzeugen und mehr als 100 Sprachen unterstützen. Leland Rechis und Alan Cowen stellen die Modelle in einem offiziellen Google-Blogbeitrag vor. Flash TTS richtet sich an Anwendungen mit eigens gestalteten …

Weiterlesen …

Meta erweitert Muse um Videochats, Agenten-E-Mail und … ein Tamagotchi?

Meta baut seinen KI-Agenten Muse mit Live-Videochats, eigenen E-Mail-Adressen, Computersteuerung auf dem Mac, Unterstützung für Smart Glasses und einem kleinen Handgerät namens Muse Charm aus. Die Ankündigungen zeigen, dass Meta Muse auf mehr Geräten verfügbar machen und den Agenten stärker in alltägliche Aufgaben einbinden will. Muse Charm ist das auffälligste neue Produkt. Meta beschreibt es …

Weiterlesen …

Rabbit OS3 bringt KI-Agenten auf Computer, Smartphone und in Messenger

Rabbit hat mit OS3 ein cloudbasiertes System für KI-Agenten vorgestellt. Es kann auf Windows-, Mac- und Linux-Rechnern mit lokalen Programmen, Dateien und Webseiten arbeiten. Julian Chokkattu berichtet für WIRED, dass sich OS3 außerdem über den Browser, Telegram, iMessage und das Rabbit-R1-Gerät nutzen lässt. Mit OS3 vollzieht Rabbit einen strategischen Wechsel. Bekannt wurde das Unternehmen mit …

Weiterlesen …

Jev soll KI-Automatisierung schneller, günstiger und verlässlicher machen

TypeSafe AI hat mit Jev ein neues KI-Modell vorgestellt, das strukturierte Entscheidungen für Software treffen soll. Statt offene Texte zu schreiben, soll Jev Aufgaben wie Klassifizierung, Bewertung, Weiterleitung und Auswahl in einem vorgegebenen Format erledigen. Nach Angaben des Unternehmens liegt die Antwortzeit je nach Aufgabe zwischen 70 und 500 Millisekunden. Das Modell richtet sich an …

Weiterlesen …

Xiaomi veröffentlicht offene MiMo-V2.6-Modelle für KI-Agenten und mehr

Xiaomi hat zwei offene multimodale KI-Modelle veröffentlicht, die anspruchsvolle Agentenaufgaben zu deutlich niedrigeren Kosten als viele proprietäre Angebote übernehmen sollen. MiMo-V2.6-Pro und MiMo-V2.6-Flash verarbeiten Text, Bilder, Audio und Video. Sie unterstützen ein Kontextfenster von bis zu einer Million Tokens und richten sich an Aufgaben mit vielen Arbeitsschritten, etwa Programmierung, Recherche, Gestaltung und die Bedienung von …

Weiterlesen …

Tencent bringt dialogbasierte Bildbearbeitung in Hy Image 3.5 Preview

Tencent veröffentlicht mit Hy Image 3.5 Preview eine Bild-KI, die Bearbeitungen über mehrere Gesprächsschritte hinweg fortführen kann. Die API kostet laut Tencent 0,024 US-Dollar pro erzeugtem Bild und verarbeitet Textanweisungen, Referenzbilder sowie aufeinanderfolgende Änderungen. Ryan Merket berichtet für RuntimeWire, dass Tencent damit vor allem Anwendungen für iterative kreative Arbeit ansprechen will. Bei Hy Image 3.5 …

Weiterlesen …

Anthropic baut Claude Projects für parallele Arbeitsabläufe um

Anthropic erweitert seine Projects-Funktion in Claude Code: Nutzer sollen ein übergeordnetes Arbeitsziel in einem Chat formulieren können, während Claude die Aufgaben auf mehrere parallele Threads verteilt. Anthropic kündigt dies in einem offiziellen Beitrag im Claude-Blog an. Die überarbeitete Funktion startet zunächst als Beta für ausgewählte Pro- und Max-Abonnenten mit Cloud-Sitzungen in Claude Code. Im Zentrum …

Weiterlesen …

Google stellt Gemini 3.8 Live für Sprachassistenten vor

Google bringt mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei neue KI-Modelle für gesprochene Gespräche, Sprachassistenten und Aufgaben mit Bildverständnis und Werkzeugaufrufen auf den Markt. Tom Ouyang und Malini Jaganathan stellen die Modelle im offiziellen Blog von Google vor. Gemini 3.8 Live richtet sich laut Google an Anwendungen, die viele Gespräche effizient …

Weiterlesen …

Qwen veröffentlicht Qwen-Image-2.1 mit Transparenz und Bildbearbeitung

Alibabas KI-Sparte Qwen hat Qwen-Image-2.1 veröffentlicht, ein Open-Weight-Modell für Bildgenerierung und Bildbearbeitung mit einer visuellen Komponente von 7 Milliarden Parametern. Qwen stellt das Modell in einem offiziellen Blogbeitrag vor und nennt Transparenz, Bearbeitung mehrerer Vorlagen und effizientere Berechnungen als zentrale Neuerungen. Das Modell soll Bilder nicht nur aus Texteingaben erzeugen. Es kann vorhandene Bilder verändern, …

Weiterlesen …

OpenAI holt GPT-6 mit Sol und Luna aus der High-End-Nische

OpenAI stellt mit GPT-6 Sol und GPT-6 Luna zwei günstigere Modelle für professionelle Aufgaben, Softwareentwicklung und KI-Agenten vor. Nach Angaben des Unternehmens basieren beide Modelle auf ähnlichen Trainingsmethoden wie das Spitzenmodell GPT-6 Astra. Gleichzeitig sinken die API-Preise gegenüber den Aktionspreisen der Vorgängermodelle GPT-5.6 um rund 50 Prozent. GPT-6 Sol kostet für Entwickler 2 US-Dollar pro …

Weiterlesen …

×