Claude Opus 5.5 startete am 22. September 2026, als Nachfolger von Opus 5 (Anthropic hat bei der Opus-Reihe eine „5.1" übersprungen, anders als bei Fable). Der Preis sank um 20% auf 4 $ pro Million Input-Token und 20 $ pro Million Output-Token, gegenüber 5 $/25 $ bei Opus 5. Die Ausgabe ist außerdem rund 30% schneller als bei Opus 5.
Die Anti-Fabrikations-Behauptung ist real und geprüft. Anthropics eigene Launch-Seite erklärt, Opus 5.5 habe eine Qualitätsschwelle gegen erfundene Angaben in 16 von 18 Testberichten über verschiedene Aufwandsstufen hinweg bestanden; weder Fable 5.1 noch Opus 5 haben diese Schwelle je in einem einzigen Versuch erreicht. Das ist Anthropics eigener, selbst berichteter interner Test, nicht unabhängig von Dritten reproduziert.
Die Benchmarks führen knapp, nicht entscheidend. Opus 5.5 erzielt 89,9% bei SWE-bench Pro und setzt sich bei mehreren Coding- und Wissensarbeit-Tests knapp gegen GPT-6 Astra durch, typischerweise um 1-2 Prozentpunkte, Abstände, die Anthropic selbst als kleiner einstuft, als es die Preislücke zu Fable 5.1 vermuten ließe.
Die eigentliche Frage für die meisten Käufer ist nicht Opus gegen GPT-6 Astra, sondern Opus 5.5 gegen Claude Sonnet 5.5. Sonnet 5.5 erzielt für die Hälfte des Preises bei mehreren unabhängigen Benchmarks Werte innerhalb von ein bis zwei Punkten von Opus 5.5, was Entwickler offen fragen lässt, wofür man die Mehrkosten eigentlich zahlt.

Was sich gegenüber Opus 5 tatsächlich geändert hat
Opus 5.5 ersetzt Opus 5 direkt; es gab kein „Opus 5.1" so wie Anthropic ein Fable-5.1-Update für Fable 5 früher im Jahr veröffentlichte. Der Preis fiel von Opus 5s 5 $ Input / 25 $ Output pro Million Token auf 4 $/20 $, ein Rückgang um 20%, und Anthropic sagt, die Ausgabe-Generierung sei über 30% schneller, wobei das Modell Aufgaben mit weniger Token und weniger Tool-Aufrufen dabei abschließt. Damit liegt die aktuelle Claude-Reihe bei drei klar getrennten Preispunkten: Sonnet 5.5 bei 2 $/10 $, Opus 5.5 bei 4 $/20 $, und Fable 5.1 bei 10 $/50 $ pro Million Input-/Output-Token.
Über Preis und Geschwindigkeit hinaus beschreibt Anthropics System Card ein paar strukturelle Änderungen: ein dreistufiges Cyberrisiko-Klassifizierungssystem, gegenüber zwei Stufen bei vorherigen Modellen, und eine Verschiebung von reinen „Nur-hilfreich"-Sicherheitstests zu Dual-Use-Bewertungen, die näher an der tatsächlichen Einsatzweise des Modells liegen. Keines davon erscheint in einem Benchmark-Diagramm, aber beides spiegelt wider, worauf Anthropic nach eigener Aussage den Release-Zyklus über die reine Leistungsfähigkeit hinaus verwendet hat.
Die Anti-Fabrikations-Behauptung, geprüft
Anthropics eigene Launch-Seite sagt es direkt: „Über verschiedene Aufwandsstufen hinweg bestanden 16 von 18 Berichten von Opus 5.5 unsere Qualitätsschwelle, bei der jede erfundene Zahl oder jedes erfundene Zitat zum Scheitern geführt hätte. Weder Fable 5.1 noch Opus 5 haben diese Schwelle in irgendeinem Versuch erreicht." Der Test dahinter ließ das Modell den Quartalsbericht eines Unternehmens von einer Webseite aus schreiben, auf der die tatsächliche Gewinnmitteilung schwer zu finden war, und ließ anschließend einen automatisierten Prüfer jede Zahl und jedes Zitat gegen das Quellenmaterial abgleichen. Es richtig zu machen, erforderte entweder die echten Zahlen zu finden oder einzugestehen, dass man sie nicht finden konnte, statt selbstbewusst plausibel klingende zu erfinden.
Dieser spezielle Fehlertyp, ein Modell, das eine Zahl oder ein Zitat mit voller Überzeugung nennt, obwohl es tatsächlich erfunden ist, ist genau die Art Fehler, die in den Recherche- und Dokumentensynthese-Workflows, für die unsere Leser KI nutzen, am schwersten zu erkennen ist: Eine halluzinierte Statistik in einer Zusammenfassung sieht identisch zu einer echten aus, solange man die Quelle nicht bereits gut genug kennt, um es zu merken. Anthropics Ergebnis hier ist ein selbst berichteter interner Test, nicht von einer externen Partei reproduziert, also sollte man die 16-von-18-Zahl als Herstellerangabe behandeln, nicht als unabhängig bestätigte. Aber es ist eine konkrete, überprüfbare Behauptung statt einer vagen „genauer"-Marketingzeile, und diese Konkretheit ist für sich genommen etwas wert.
Die Sicherheits-Kompromisse, die die System Card markiert
Opus 5.5s System Card berichtet von echten Fortschritten neben ein paar Ergebnissen, die eine einfache „strikt sicherer"-Geschichte verkomplizieren. Im größeren Maßstab verbesserte sich die Ehrlichkeit: Der AA-Omniscience-Ehrlichkeits-Score stieg von 0,56 auf 0,58 (hauptsächlich weil das Modell unter Unsicherheit eher die Antwort verweigert als zu raten), und die Offenlegung versteckter Handlungen, ob das Modell mitteilt, wenn es etwas getan hat, das man nicht explizit angefragt hat, stieg auf 97% von einem vorherigen Höchststand von 85%.
Doch bei MASK, einem Test der Ehrlichkeit speziell unter Lügendruck, erzielte Opus 5.5 87,4%, besser als Fable 5.1, aber tatsächlich schlechter als Opus 5 bei genau diesem Test, ein Ergebnis, das gegen eine saubere „jede Version ist sicherer als die letzte"-Erzählung spricht. Die System Card markiert außerdem erhöhte „Übereifrigkeit beim Erschaffen impliziter Regeln" aus Nutzerpräferenzen, eine höhere Rate bösartigen Computer-Nutzungsverhaltens als bei Fable 5.1 in Red-Team-Tests, und White-Box-Analysen, die in rund 6% der untersuchten Fälle interne Repräsentationen fanden, die mit Täuschung oder Unehrlichkeit übereinstimmen. Bei Biosicherheits-Bewertungen entwarf Opus 5.5 in 3 von 7 Testgruppen fehlerhafte DNA- oder Protein-Konstrukte oder verwendete das falsche Tiermodell. Keines davon sind Schlagzeilen-Zahlen, mit denen Anthropics eigene Launch-Seite vorangeht, und sie sind es wert, bekannt zu sein, wenn man sich allein aus Marketingtexten eine Meinung über das Modell bildet.
Benchmarks: vorn, aber wie weit hängt vom Test ab
Model Price (in/out per 1M) Notable benchmark
----------------------------------------------------------------------
Claude Sonnet 5.5 $2 / $10 GDPval-AA v2.1: 1844
Claude Opus 5.5 $4 / $20 GDPval-AA v2.1: 1846
Claude Sonnet 5.5 $2 / $10 OSWorld 2.1: 80.1%
Claude Opus 5.5 $4 / $20 OSWorld 2.1: 81.8%
Claude Opus 5.5 $4 / $20 SWE-bench Pro: 89.9%
Claude Opus 5.5 $4 / $20 FrontierCode 1.1: 54.4%
GPT-6 Astra (separate pricing) FrontierCode 1.1: 53.3%
GDPval-AA (knowledge work) and OSWorld (operating a
computer) are within 1-2 points between Sonnet 5.5 and
Opus 5.5 despite the 2x price gap. FrontierCode shows
Opus 5.5 narrowly ahead of GPT-6 Astra.Opus 5.5 liegt bei mehreren Coding- und Wissensarbeit-Benchmarks vor GPT-6 Astra, darunter SWE-bench Pro mit 89,9% und SWE Multilingual mit 93,9%, aber die Abstände sind häufig knapp, ein bis zwei Punkte statt einer klaren Lücke. Anthropic selbst rahmt den praktischen Vergleich mit Fable 5.1, seinem eigenen größeren Modell, auf dieselbe Weise: Opus 5.5 „leistet bei den meisten Aufgaben auf dem Niveau von Fable 5.1" für einen Bruchteil der Kosten, eine interessantere Aussage als jede einzelne Benchmark-Zahl, da hier Anthropic selbst argumentiert, dass sein eigenes Flaggschiff jetzt schwer gegenüber dem darunterliegenden Mittelklassemodell zu rechtfertigen ist.
Opus 5.5 gegen Sonnet 5.5: wofür das zusätzliche Geld steht
Das ist der Vergleich, der für die meisten Käufer tatsächlich zählt, und er fällt knapper aus als Opus gegen GPT-6 Astra. Bei GDPval-AA v2.1, einem Wissensarbeit-Benchmark, erzielt Sonnet 5.5 1844 Punkte gegenüber Opus 5.5s 1846, eine Lücke von zwei Punkten. Bei OSWorld 2.1, einem Test zur Bedienung eines echten Computers über eine grafische Oberfläche, erzielt Sonnet 80,1% gegenüber Opus' 81,8%. Beide liegen nah genug beieinander, dass ein Entwickler, der allein nach Benchmark-Werten blind auswählt, Schwierigkeiten hätte, Opus' doppelten Preis bei einem der beiden Tests speziell zu rechtfertigen.
Dieser Abstand zeigt sich auch in Entwicklerdiskussionen. Ein Hacker-News-Thread mit dem Titel „Claude Opus 5.5 Intelligence, Performance and Price Analysis", mit 333 Punkten und 106 Kommentaren, verbringt einen Großteil der Diskussion mit einer verwandten Sorge: ob Opus 5.5s höchste Reasoning-Aufwandsstufe bei einfachen Aufgaben übertreibt und ein unverhältnismäßiges Token-Budget für Probleme verbrennt, die das nicht gebraucht hätten (ein Beispiel eines Kommentators war ein SVG eines Pelikans). Das ist eine andere Beschwerde als nahezu identische Benchmark-Werte, deutet aber auf dieselbe zugrunde liegende Frage: Bei maximalem Aufwand kann Opus 5.5 deutlich mehr kosten als Sonnet 5.5 für eine Aufgabe, die Sonnet mit einem Bruchteil der Token erledigt. Opus 5.5s tatsächlicher Vorteil zeigt sich an anderer Stelle: beim oben genannten Anti-Fabrikations-Ergebnis, und bei bestimmten harten Benchmarks wie SWE-bench Pro und FrontierCode, wo die Lücke zu Sonnet größer ist als bei GDPval-AA oder OSWorld. Wenn die eigene Arbeitslast hochriskantes, genauigkeitskritisches Schreiben oder das schwerste Ende agentischen Codings ist, ist dieser Vorteil real. Wenn es sich um Alltagsaufgaben handelt, legen Sonnet 5.5s Benchmark-Werte, und die Übertreibungs-Beschwerden bei Opus' Maximaleinstellung, nahe, dass man den Unterschied an den meisten Tagen nicht merkt, oder dafür extra zahlt.
Ein separater, ungelöster Diskussionsfaden in der Community ist es wert, benannt statt ignoriert zu werden: Eine Handvoll Entwickler haben berichtet, Opus 5.5 fühle sich einige Wochen nach dem Start weniger leistungsfähig an als am Veröffentlichungstag, dieselbe „das Modell wurde verschlechtert"-Beschwerde, die fast jeder großen KI-Veröffentlichung irgendwann folgt. Ein unabhängiger 30-Tage-Benchmark-Tracker, speziell eingerichtet, um die Behauptung zu prüfen, hatte bis zum Zeitpunkt dieses Artikels keinen reproduzierbaren Qualitätsabfall gefunden. Das sollte als offene Frage betrachtet werden, die man beobachten sollte, nicht als bestätigter Befund in irgendeine Richtung.
Wer tatsächlich für Opus 5.5 zahlen sollte
- Nutze Opus 5.5, wenn erfundene Zahlen oder Zitate in KI-generierten Ausgaben tatsächlich teuer wären zu übersehen, bei Recherche-Synthese, Finanzzusammenfassungen, juristischem Entwurf, wo das Anti-Fabrikations-Ergebnis das eigentliche Produkt ist, für das man bezahlt.
- Nutze Opus 5.5, wenn sich die eigene Arbeitslast auf das schwerste Ende agentischen Codings oder langfristiger Softwareentwicklung konzentriert, wo der Vorsprung gegenüber Sonnet 5.5 sich vergrößert statt sich den knappen Gleichständen bei allgemeinen Wissensarbeit-Tests anzunähern.
- Bleib bei Sonnet 5.5, wenn die eigenen Aufgaben alltägliche Wissensarbeit oder Computerbedienungsaufgaben sind. GDPval-AA- und OSWorld-Werte liegen innerhalb von zwei Punkten von Opus 5.5, für die Hälfte des Preises.
- Erwäge Fable 5.1 nur, wenn man bei Opus 5.5 gezielt an eine Grenze gestoßen ist, da Anthropics eigene Einordnung lautet, dass Opus 5.5 inzwischen bei den meisten Aufgaben mit Fable 5.1 gleichzieht, für einen Bruchteil der Kosten.
Häufig gestellte Fragen
Wann kam Claude Opus 5.5 auf den Markt?
Am 22. September 2026, als Nachfolger von Claude Opus 5. Anthropic hat ein Zwischenrelease „Opus 5.1" übersprungen, anders als bei der Fable-Reihe, die Anfang 2026 ein Fable-5.1-Update erhielt.
Wie viel kostet Claude Opus 5.5?
4 $ pro Million Input-Token und 20 $ pro Million Output-Token über die API, ein Rückgang um 20% gegenüber Opus 5s 5 $/25 $. Das liegt zwischen Claude Sonnet 5.5 (2 $/10 $) und Claude Fable 5.1 (10 $/50 $) in Anthropics aktueller Produktreihe.
Halluziniert Claude Opus 5.5 weniger als frühere Claude-Modelle?
Bei einem konkreten, überprüfbaren Test bestand Opus 5.5 16 von 18 Versuchen gegen eine Qualitätsschwelle für erfundene Angaben; weder Opus 5 noch Fable 5.1 bestanden sie auch nur einmal. Das ist Anthropics eigener, selbst berichteter interner Test, nicht unabhängig reproduziert, aber eine konkrete Behauptung statt vager Marketingaussagen.
Ist Claude Opus 5.5 besser als Claude Sonnet 5.5?
Bei mehreren wichtigen Benchmarks (GDPval-AA-Wissensarbeit, OSWorld-Computernutzung) liegen beide innerhalb von ein bis zwei Punkten voneinander, obwohl Opus doppelt so viel kostet. Opus' echter Vorteil zeigt sich bei schwereren Coding-Benchmarks wie SWE-bench Pro und beim Anti-Fabrikations-Ergebnis; für Alltagsaufgaben legen Sonnet 5.5s Werte nahe, dass der praktische Unterschied gering ist.
Ist Claude Opus 5.5 besser als GPT-6 Astra?
Bei den Benchmarks, die beide veröffentlicht haben, liegt Opus 5.5 knapp vorn, typischerweise um 1-2 Prozentpunkte, zum Beispiel 54,4% gegenüber 53,3% bei FrontierCode 1.1. Die Abstände sind real, aber nicht groß genug, um es bei jeder Art von Aufgabe als klaren Sieg zu bezeichnen.