Google erweitert Gemini 3.8 Live um animierten Live Avatar

Google ergänzt Gemini 3.8 Live für Kunden von Gemini Enterprise um Live Avatar. Die Funktion zeigt während eines Gesprächs eine animierte Figur auf dem Bildschirm. Sie bewegt ihre Lippen passend zur Antwort und zeigt in Echtzeit verschiedene Gesichtsausdrücke. Emma Roth berichtet für The Verge, dass das Angebot zunächst ausschließlich für Googles Unternehmenskunden verfügbar ist. Organisationen …

Weiterlesen …

Microsoft bündelt Chat, Code und KI-Agenten in neuer Copilot-App

Microsoft führt eine neu gestaltete Copilot-App ein, die KI-Chat, Programmierung und autonome Agenten in einer Oberfläche zusammenführt. Tom Warren berichtet für The Verge, dass Microsoft zugleich seinen bisher Scout genannten KI-Assistenten in Autopilot umbenennt. Die Anwendung gliedert sich in die Bereiche Home, Code und Autopilot. Home ist die Startansicht und vereint Copilot Chat mit Cowork. …

Weiterlesen …

Suno startet v6-Modelle mit Vergütung für Musikrechte

Das KI-Musikunternehmen Suno bringt mit v6 eine neue Modellreihe auf den Markt, an der Warner Music Group und BMG beteiligt sind. Ashley Carman und Lucas Shaw berichten für Bloomberg, dass Suno bei der Nutzung der neuen Modelle Vergütungen an Inhaber von Musikrechten zahlen will. Damit grenzt sich v6 von früheren Suno-Modellen ab. Für diese erhielten …

Weiterlesen …

YouTube erweitert KI-Werkzeuge für Creator im Kampf um Talente

YouTube baut seine KI-Angebote für Creator aus. Neue Werkzeuge sollen bei der Analyse von Skripten, beim Testen von Videos und bei der Übersetzung von Livestreams helfen. Damit reagiert die Plattform auch auf den wachsenden Wettbewerb um bekannte digitale Creator. Auf dem Event „Made on YouTube“ stellte das Unternehmen etwa einen KI-gestützten Storytelling-Assistenten vor. Er kann …

Weiterlesen …

Google startet Gemini 3.8 Flash TTS und Flash-Lite TTS für ausdrucksstarke Sprache

Google stellt mit Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS zwei Modelle für Sprachsynthese vor. Sie sollen aus Text natürlichere und besser steuerbare Sprache erzeugen und mehr als 100 Sprachen unterstützen. Leland Rechis und Alan Cowen stellen die Modelle in einem offiziellen Google-Blogbeitrag vor. Flash TTS richtet sich an Anwendungen mit eigens gestalteten …

Weiterlesen …

Meta erweitert Muse um Videochats, Agenten-E-Mail und … ein Tamagotchi?

Meta baut seinen KI-Agenten Muse mit Live-Videochats, eigenen E-Mail-Adressen, Computersteuerung auf dem Mac, Unterstützung für Smart Glasses und einem kleinen Handgerät namens Muse Charm aus. Die Ankündigungen zeigen, dass Meta Muse auf mehr Geräten verfügbar machen und den Agenten stärker in alltägliche Aufgaben einbinden will. Muse Charm ist das auffälligste neue Produkt. Meta beschreibt es …

Weiterlesen …

Rabbit OS3 bringt KI-Agenten auf Computer, Smartphone und in Messenger

Rabbit hat mit OS3 ein cloudbasiertes System für KI-Agenten vorgestellt. Es kann auf Windows-, Mac- und Linux-Rechnern mit lokalen Programmen, Dateien und Webseiten arbeiten. Julian Chokkattu berichtet für WIRED, dass sich OS3 außerdem über den Browser, Telegram, iMessage und das Rabbit-R1-Gerät nutzen lässt. Mit OS3 vollzieht Rabbit einen strategischen Wechsel. Bekannt wurde das Unternehmen mit …

Weiterlesen …

Jev soll KI-Automatisierung schneller, günstiger und verlässlicher machen

TypeSafe AI hat mit Jev ein neues KI-Modell vorgestellt, das strukturierte Entscheidungen für Software treffen soll. Statt offene Texte zu schreiben, soll Jev Aufgaben wie Klassifizierung, Bewertung, Weiterleitung und Auswahl in einem vorgegebenen Format erledigen. Nach Angaben des Unternehmens liegt die Antwortzeit je nach Aufgabe zwischen 70 und 500 Millisekunden. Das Modell richtet sich an …

Weiterlesen …

Xiaomi veröffentlicht offene MiMo-V2.6-Modelle für KI-Agenten und mehr

Xiaomi hat zwei offene multimodale KI-Modelle veröffentlicht, die anspruchsvolle Agentenaufgaben zu deutlich niedrigeren Kosten als viele proprietäre Angebote übernehmen sollen. MiMo-V2.6-Pro und MiMo-V2.6-Flash verarbeiten Text, Bilder, Audio und Video. Sie unterstützen ein Kontextfenster von bis zu einer Million Tokens und richten sich an Aufgaben mit vielen Arbeitsschritten, etwa Programmierung, Recherche, Gestaltung und die Bedienung von …

Weiterlesen …

Tencent bringt dialogbasierte Bildbearbeitung in Hy Image 3.5 Preview

Tencent veröffentlicht mit Hy Image 3.5 Preview eine Bild-KI, die Bearbeitungen über mehrere Gesprächsschritte hinweg fortführen kann. Die API kostet laut Tencent 0,024 US-Dollar pro erzeugtem Bild und verarbeitet Textanweisungen, Referenzbilder sowie aufeinanderfolgende Änderungen. Ryan Merket berichtet für RuntimeWire, dass Tencent damit vor allem Anwendungen für iterative kreative Arbeit ansprechen will. Bei Hy Image 3.5 …

Weiterlesen …

×