Claude Opus 5.5 liefert Spitzenleistung deutlich günstiger

Anthropic hat mit Claude Opus 5.5 ein neues Spitzenmodell veröffentlicht. Nach Angaben des Unternehmens erreicht es bei den meisten Aufgaben annähernd das Niveau von Claude Fable 5.1. Gegenüber Opus 5 sollen die typischen Betriebskosten zugleich um 40 Prozent sinken.

Das Modell verbindet niedrigere Preise, schnellere Antworten und zusätzliche Kontrollen für riskante Anfragen. Claude Opus 5.5 ist laut Anthropic über die eigenen Produkte sowie über Amazon Web Services, Google Cloud und Microsoft Azure verfügbar.

Der Preis liegt bei 4 Dollar pro Million Input-Token und 20 Dollar pro Million Output-Token. Für Cache Reads verlangt Anthropic 0,20 Dollar pro Million Token. Dabei greift das System auf bereits verarbeiteten Kontext zurück. Das kann vor allem bei längeren Arbeitsabläufen, etwa mit Coding-Agenten, Kosten senken. Anthropic erklärt zudem, Opus 5.5 benötige pro Aufgabe weniger Token und liefere Antworten mehr als 30 Prozent schneller als Opus 5.

Ausgelegt auf komplexe Arbeitsabläufe

Anthropic sieht die Stärken des Modells bei langen Aufgaben mit vielen Einzelschritten. Im Benchmark Terminal-Bench 4.0, der professionelle Aufgaben in einer Kommandozeile prüft, erreichte Opus 5.5 laut Unternehmen 66,4 Prozent. Beim Coding-Benchmark FrontierCode nennt Anthropic 54,4 Prozent. Dort wird bewertet, ob Änderungen an Programmcode vermutlich in ein Projekt übernommen würden.

Für GDPval-AA, einen Test mit Tätigkeiten aus verschiedenen Berufsgruppen, gibt Anthropic einen Wert von 1.846 Elo an. In einem internen Versuch sollte das Modell Berichte zur Quartalsentwicklung eines Unternehmens erstellen. Die nötigen Quellen waren dabei absichtlich schwer auffindbar. Anthropic zufolge erfüllten 16 von 18 Berichten die Vorgaben. Jede erfundene Zahl oder jedes falsche Zitat hätte zum Scheitern geführt.

Ein großer Teil dieser Werte stammt aus Tests von Anthropic selbst. Das Unternehmen weist darauf hin, dass Benchmark-Ergebnisse reale Unterschiede zwischen leistungsstarken Modellen nur begrenzt abbilden. Die unabhängige Plattform Artificial Analysis führt Opus 5.5 dennoch an der Spitze ihres Intelligence Index.

Außerdem soll das Modell verständlicher schreiben als frühere Claude-Versionen. Anthropic verspricht klarere Prioritäten, weniger Fachsprache und eine zuverlässigere Umsetzung von Stilvorgaben. Das könnte für Teams in Redaktion, Kommunikation und anderen Wissensberufen wichtig sein, besonders bei längeren Recherche-, Planungs- oder Überarbeitungsprozessen.

Kontrollen leiten bestimmte Anfragen um

Opus 5.5 ist das erste Opus-Modell mit Schutzmaßnahmen, die denen von Fable 5.1 in den Bereichen Cybersicherheit, Biologie und Distillation ähneln. Distillation bezeichnet den Versuch, Fähigkeiten eines Modells über sehr viele Anfragen systematisch zu kopieren. Wenn die Kontrollen greifen, beantwortet nicht unbedingt Opus 5.5 die Anfrage. Sie kann stattdessen an ein anderes Modell weitergeleitet werden.

Die meisten Cybersicherheitsanfragen sollen laut Anthropic an Opus 4.8 gehen. Normale Fehlersuche im eigenen Code bleibt jedoch möglich. Anfragen zu Biologie oder zur Entwicklung besonders leistungsfähiger KI-Systeme können an Opus 5 weitergeleitet werden. Geprüfte Organisationen können einen erweiterten Zugang für zulässige Forschungs- und Sicherheitsarbeit beantragen.

Im automatisierten Verhaltensaudit von Anthropic schnitt Opus 5.5 nach Unternehmensangaben besser ab als frühere Claude-Modelle. Die Tests umfassen fast 2.000 simulierte Szenarien. Das Modell habe etwa 85 Prozent seltener versucht, Grenzen einer Testumgebung zu umgehen, als Opus 5 oder Claude Mythos 5.1. Anthropic räumt zugleich ein, dass das Modell Tests mitunter erkennt. Das erschwert Vorhersagen über sein Verhalten in allen realen Einsatzsituationen.

Vor der Veröffentlichung prüften laut Anthropic auch Frontier Design und METR das System. The Verge berichtet, die Einführung stehe im Zusammenhang mit wachsenden Sorgen der Branche über Modelle, die in Tests Sicherheitsgrenzen umgehen oder schädliche Handlungen ausführen. Anthropic verbindet den Start daher mit der Forderung nach stärkeren Prüfverfahren, Zugangskontrollen und Überwachung.

Quellen

Bleib auf dem Laufenden

KI für Contentprofis: die neuesten Tools, Tipps und Trends. Alle 14 Tage in deine Inbox:

 

Weitere Infos …

Über den Autor

Mehr zum Thema:

×