OpenAI testet einen Dauermodus für KI-Agenten

OpenAI erprobt einen „Persistent mode“ für seinen KI-Agenten innerhalb von Codex. Der Modus könnte der KI erlauben, an Aufgaben weiterzuarbeiten, bis Nutzer ihn anhalten. Maxwell Zeff berichtet für WIRED, dass Hinweise auf die Funktion in öffentlichen Änderungen am Code der Kommandozeilenversion von Codex auftauchen. Der Modus ist noch nicht allgemein verfügbar. OpenAI erklärt, es gebe …

Weiterlesen …

Gemini Notebook macht die eigenen E-Books zu einer Quelle für KI-Antworten

Google erweitert Gemini Notebook um Expert Intelligence. Mit der Funktion können Nutzer ausgewählte Bücher, die sie bei Google Play Books gekauft haben, als Quellen in die KI-Anwendung übernehmen. Emma Roth berichtet für The Verge, dass sich daraus Fragen beantworten sowie Pläne, Infografiken und KI-Podcasts erstellen lassen. Nutzer können den vollständigen Text solcher Bücher auch direkt …

Weiterlesen …

Claude Cowork erledigt Webaufgaben jetzt direkt in der Desktop-App

Anthropic stattet Claude Cowork mit einem integrierten Browser aus. Das KI-System kann damit Websites in der Desktop-App öffnen, Inhalte lesen, Schaltflächen anklicken und Texte eingeben. Die Funktion soll etwa beim Ausfüllen von Formularen oder beim Abrufen von Zahlen aus Online-Dashboards helfen, die keine API anbieten. Der Browser erscheint in einer Seitenleiste der Claude-App. Er basiert …

Weiterlesen …

Google erweitert Gemini Omni 1.1 Flash um Szenenverlängerung und 4K

Google bringt mit Gemini Omni 1.1 Flash eine neue Version seines Modells für generative Videos. Die Aktualisierung soll Entwicklern und Kreativteams mehr Einfluss auf die Erstellung, Verlängerung und Nachbearbeitung von Videoclips geben. Neu sind unter anderem die Fortsetzung bestehender Szenen, Vorgaben für Anfangs- und Endbild, günstigere Entwürfe sowie Video-Referenzen und Ausgaben bis 4K. Im Mittelpunkt …

Weiterlesen …

Gemini Live erhält Sprachsteuerung für Aufgaben, Tagesüberblicke und E-Mails

Google baut Gemini Live zu einem Sprachassistenten für komplexere Aufgaben, Tageszusammenfassungen und die E-Mail-Verwaltung aus. In einem offiziellen Beitrag im Google Blog kündigt Neel Joshi die Verbindung von Gemini Live mit Spark an. Spark soll mehrstufige Aufträge selbstständig bearbeiten. Nutzer können ihr Ziel per Sprache beschreiben. Das System arbeitet laut Google mit Docs, Sheets, Drive …

Weiterlesen …

Alibaba verspricht mit Qwen3.8-Flash-Next starke KI-Leistung zum Niedrigpreis

Alibaba hat Qwen3.8-Flash-Next vorgestellt, ein multimodales KI-Modell für Programmierung, Büroarbeit und andere Aufgaben, die externe Tools nutzen. Matthias Bastian berichtet bei The Decoder, dass das Modell zugleich einen Ausblick auf technische Konzepte der kommenden Qwen4-Reihe geben soll. Das Modell besitzt insgesamt 125 Milliarden Parameter. Für jedes verarbeitete Token aktiviert es jedoch nur 6 Milliarden davon. …

Weiterlesen …

Gemini 3.5 Transcribe von Google soll aus gesprochener Sprache sauberen Text machen

Google stellt mit Gemini 3.5 Transcribe ein neues Modell für die Umwandlung von Sprache in Text vor. Es richtet sich an Anwendungen für Live-Gespräche, Meeting-Aufzeichnungen und sprachgesteuerte Arbeitsabläufe. Nach Angaben des Unternehmens verarbeitet das Modell auch Hintergrundgeräusche, Fachbegriffe, Akzente und Selbstkorrekturen besser als herkömmliche Spracherkennung. Für Entwickler gibt es zwei Schnittstellen. gemini-3.5-transcribe-live arbeitet über die …

Weiterlesen …

Z.ai bestätigt Ox Alpha als GLM-5.3-Flash

Das chinesische KI-Unternehmen Z.ai hat bekannt gegeben, dass das zunächst anonyme Modell Ox Alpha mit GLM-5.3-Flash identisch ist. Das neue multimodale Modell wird zu einem künftigen Zeitpunkt frei zur Verfügung stehen. Entwickler können das System damit selbst betreiben, anpassen und als Grundlage für eigene Produkte nutzen. Luz Ding berichtet für Bloomberg, dass Ox Alpha rasch …

Weiterlesen …

Thomson Reuters startet eigenes KI-Modell

Thomson Reuters bringt mit Thomson ein eigenes großes Sprachmodell auf den Markt. Zunächst soll es in CoCounsel Legal eingesetzt werden. In einer offiziellen Mitteilung erklärt Thomson Reuters, das Modell sei intern entwickelt worden. Als Ausgangspunkt diente ein leistungsfähiges Open-Source-Modell. Nach Angaben des Unternehmens flossen rund 40 Millionen Dollar in Fachpersonal und Rechenleistung. Thomson Reuters betont, …

Weiterlesen …

Claude nutzt Wissen aus dem Chat nun auch in Cowork (und umgekehrt)

Anthropic führt die bisher getrennten Notizen (Memory) von Claude Chat und Claude Cowork zusammen. Gespeicherte Informationen aus Unterhaltungen können damit künftig zwischen dem Chatbot und dem auf Arbeitsaufgaben ausgerichteten Tool Cowork genutzt werden. David Gewirtz schreibt für ZDNET, dass der Abgleich in beide Richtungen funktioniert. Was Nutzer in Cowork erarbeiten, kann Claude später auch im …

Weiterlesen …

×