KI
KIFortgeschritten

Claude Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5: 20× günstiger als Sonnet – mit einer Preisstufe bei 100K Tokens

Claude Haiku 5.5, Sonnet 5.5 und Opus 5.5 im Vergleich: Anthropics Benchmarks, Listenpreise und Monatskosten für drei reale Workloads, die Preisstufe bei 100.000 Tokens, die nur Haiku hat, was bei der Migration von Haiku 4.5 bricht und wie Opus plant, während Haiku die Arbeit erledigt.

Titelbild: Claude Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5: 20× günstiger als Sonnet – mit einer Preisstufe bei 100K Tokens
Inhalt

Anthropic hat Claude Haiku 5.5 am 7. Oktober veröffentlicht, und zwei Zahlen aus dem Launch-Beitrag werden die meiste Aufmerksamkeit bekommen: ein Preis und ein Sprung. Der Preis: 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens, ein Zwanzigstel von Sonnet 5.5. Der Sprung: Bei Terminal-Bench 4.0, einem Benchmark für agentisches Coding, kam Haiku 4.5 auf 0,0 %, Haiku 5.5 auf 39,2 %.

Die naheliegende Lesart lautet „ein billiges Sonnet“. Das ist es nicht, und wer es so behandelt, zahlt zu viel oder liefert schlechtere Ergebnisse. Dieser Leitfaden vergleicht Haiku 5.5 mit Sonnet 5.5 und Opus 5.5 anhand von Anthropics veröffentlichten Zahlen, rechnet aus, was drei reale Workloads pro Monat auf jedem Modell kosten, und erklärt die eine Preisregel, die nur Haiku hat: Ab 100.000 Tokens kostet dieselbe Anfrage das Fünffache.

Claude Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5: 0,10 $ vs. 2 $ vs. 4 $ pro Million Input-Tokens, Terminal-Bench-4.0-Werte und eine 5-fache Preisstufe für Prompts über 100K Tokens

Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5 auf einen Blick

Die Angaben stammen von der Modellseite zu Haiku 5.5, der Modellübersicht und der Preisseite.

Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5 auf einen Blick
Claude Haiku 5.5 Claude Sonnet 5.5 Claude Opus 5.5
API-Modell-ID claude-haiku-5-5 claude-sonnet-5-5 claude-opus-5-5
Input / Output pro Million Tokens 0,10 $ / 0,50 $ (Prompts ≤ 100K) 2 $ / 10 $ 4 $ / 20 $
Prompts über 100K Tokens 0,50 $ / 2,50 $ unverändert unverändert
Cache Read pro Million Tokens 0,01 $ (0,05 $ über 100K) 0,10 $ 0,20 $
Batch API Input / Output 0,05 $ / 0,25 $ 1 $ / 5 $ 2 $ / 10 $
Kontextfenster / max. Output 1M / 128K 1M / 128K 1M / 128K
Thinking Adaptiv; abschaltbar Adaptiv; Minimum between_tools Adaptiv, immer aktiv
Standard-Effort auf der Claude API medium high medium
Relative Latenz Am schnellsten Schnell Mittel
Wissensstand Juni 2026 Juni 2026 Juni 2026
Anthropics eigene Beschreibung „Für hochvolumige, latenzkritische Aufgaben wie Klassifizierung, Extraktion und Routing“ „Die beste Kombination aus Geschwindigkeit und Intelligenz“ „Für langlaufendes agentisches Coding und Wissensarbeit“

Drei Zeilen verdienen einen zweiten Blick:

  • Cache Reads kosten bei Haiku 10 % des Inputs, bei Sonnet und Opus 5 %. Am Launch-Tag von Haiku 5.5 hat Anthropic außerdem den Cache-Read-Preis von Sonnet 5.5 auf 0,10 $ halbiert, was Sonnet 5.5 laut Anthropic bei den meisten agentischen Aufgaben rund 20 % günstiger macht. Haikus Cache Read ist trotzdem zehnmal billiger als der von Sonnet. Warum Cache Reads Agent-Rechnungen dominieren, steht in der Cache-Read-Regel bei den Preisen von Fable und Mythos.
  • Nur Haiku 5.5 wird nach Prompt-Länge abgerechnet. Die anderen beiden verlangen von 9K bis 900K Tokens denselben Preis pro Token. Dazu unten mehr, denn das verändert, wie Sie Pipelines für lange Dokumente bauen sollten.
  • Der Standard-Effort unterscheidet sich wieder. Haiku und Opus starten mit medium, Sonnet mit high. Setzen Sie output_config.effort in jedem A/B-Test explizit.

Haiku 5.5 gibt es auf der Claude API, Amazon Bedrock (anthropic.claude-haiku-5-5), Google Cloud, Microsoft Foundry und Claude Platform on AWS. Zusätzlich führt Anthropic monatliche API-Guthaben für Max- und Team-Abos ein – 100 $ bei Max 5x, 200 $ bei Max 20x und bis zu 500 $ gepoolt bei Team, nutzbar für jedes Modell. Das reicht, um jedes Muster aus diesem Artikel als Prototyp zu testen, bevor echter Traffic darauf läuft.

Die Benchmarks: ein riesiger Sprung und eine klare Decke

Das sind die Zahlen aus Anthropics Launch-Beitrag. Die Tabelle dort vergleicht Haiku 5.5 mit Haiku 4.5, OpenAIs GPT-6 Luna und Sonnet 5.5. OSWorld bezieht sich hier auf das Offline-Subset und ist daher nicht direkt mit den 80,1 % vergleichbar, die Sonnet 5.5 im eigenen Launch-Beitrag auf dem vollständigen Benchmark erreichte.

Die Benchmarks: ein riesiger Sprung und eine klare Decke
Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
Terminal-Bench 4.0 (agentisches Coding im Terminal) 39,2 % 0,0 % 16,4 % 70,6 %
FrontierCode 1.1 Main (mergebare Änderungen) 46,4 % – 42,4 % 52,1 % auf xhigh
OSWorld 2.1, Offline-Subset (Computer Use) 72,4 % 15,7 % 48,9 % 83,9 %
GDPval-AA v2.1 (Wissensarbeit, Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Wissensarbeit, Elo) 1578 614 1336 1824
Humanity’s Last Exam, ohne / mit Tools 45,9 % / 57,4 % 10,2 % / 18,7 % – 56,9 % / 64,5 %
Chartography, ohne Tools (visuelles Reasoning) 46,4 % 6,4 % 29,1 % 61,6 %
Benchmark-Vergleich von Claude Haiku 4.5, Haiku 5.5 und Sonnet 5.5: Haiku 5.5 erreicht 86 % von Sonnets OSWorld-Wert, aber nur 56 % seines Terminal-Bench-4.0-Werts, zu einem Zwanzigstel des Preises
Bei Computer Use und Wissensarbeit schließt Haiku 5.5 den Großteil der Lücke. Bei langem agentischem Coding etwa die Hälfte.

Drei Dinge lassen sich aus der Tabelle ablesen:

  1. Computer Use ist die Überraschung. 72,4 % bei OSWorld sind 86 % von Sonnets Wert zu 5 % seines Preises, und Haiku 5.5 ist bei Standardgeschwindigkeit Anthropics schnellstes Modell. Deshalb positioniert Anthropic es für Live-Kundensupport und Browser Use, und deshalb unterstützt das neue Browser-Use-Tool Haiku 5.5 (Haiku 4.5 nicht). Das Toolset fügt jeder Anfrage rund 6.600 Input-Tokens hinzu – 0,00066 $ bei Haiku, 0,0132 $ bei Sonnet.
  2. Bei langem agentischem Coding zeigt sich die Decke. 39,2 % gegenüber 70,6 % bei Terminal-Bench sind etwa die Hälfte von Sonnets Wert. Anthropic sagt das offen: Sonnet 5.5 und Opus 5.5 bleiben für komplexes agentisches Coding die bessere Wahl, Haiku 5.5 eignet sich für eng umrissene Aufgaben wie Compaction, Zusammenfassungen oder Subagent-Arbeit. FrontierCode, das abgegrenzte, mergebare Änderungen belohnt, liegt deutlich näher: 46,4 % gegenüber 52,1 %.
  3. Die eigentliche Geschichte ist der Sprung gegenüber Haiku 4.5. GDPval-AA hat sich mehr als verdoppelt, OSWorld stieg von 15,7 % auf 72,4 %. Das Kontextfenster wächst von 200K auf 1M Tokens, der maximale Output von 64K auf 128K, und es ist das erste Haiku mit einstellbarem Effort. Wer heute Haiku 4.5 einsetzt, bekommt ein Upgrade – offen ist nur, wie viel Sonnet-Traffic mit nach unten wandern kann.

Hinter dem Tempo-Versprechen steht eine erste Kundenzahl: Asana hat Haiku 5.5 mit seinem Agenten AI Teammates getestet und gegenüber dem aktuell eingesetzten Modell mehr als 30 % geringere Latenz bis zum Abschluss einer Aufgabe und bis zu 2,5-mal schnellere Inferenz pro Agent-Turn gemessen.

Wie immer gilt: Das sind Herstellerangaben. Nutzen Sie sie als Karte dafür, wo Sie eigene Evals fahren, nicht als Ersatz dafür.

Die 100K-Stufe: Haikus Preis hängt von der Prompt-Länge ab

Die Preisseite sagt es deutlich: Claude 4.6 und neuere Modelle berechnen über das gesamte 1M-Kontextfenster denselben Preis – außer Claude Haiku 5.5, das nach Prompt-Länge abgerechnet wird: Ein Prompt mit mehr als 100.000 Tokens zahlt höhere Preise.

Die 100K-Stufe: Haikus Preis hängt von der Prompt-Länge ab
Haiku-5.5-Preis pro Million Tokens Prompt ≤ 100K Tokens Prompt > 100K Tokens
Input 0,10 $ 0,50 $
Output 0,50 $ 2,50 $
5-Minuten-Cache-Write 0,125 $ 0,625 $
1-Stunden-Cache-Write 0,20 $ 1,00 $
Cache Read 0,01 $ 0,05 $
Batch Input / Output 0,05 $ / 0,25 $ 0,25 $ / 1,25 $

Jeder Preis steigt um das Fünffache – auch der Output. Ein Prompt mit 99K Tokens kostet rund 0,0099 $ Input, einer mit 101K Tokens rund 0,0505 $. Laut Anthropic lagen etwa 90 % der Haiku-4.5-Anfragen unter 100K. Deshalb nennt Anthropic im Schnitt „rund 75 % weniger“ statt der 90 %, die der Listenpreis für kurze Prompts nahelegt. Der andere Teil der Differenz ist der Tokenizer: Haiku 5.5 nutzt den neueren Tokenizer, der mit Claude Opus 4.7 eingeführt wurde, und derselbe Text ergibt rund 30 % mehr Tokens als bei Haiku 4.5. Nach der Faustregel der Doku von etwa 555.000 englischen Wörtern pro Million Tokens entsprechen 100K Tokens rund 55.000 Wörtern Englisch; deutscher Text braucht pro Wort meist mehr Tokens.

Die 100K-Preisstufe bei Claude Haiku 5.5: Die Input-Kosten pro Anfrage steigen linear bis 0,01 $ bei 100K Tokens, springen dann um das Fünffache auf etwa 0,05 $ und steigen mit dem höheren Satz weiter, während Sonnet 5.5 und Opus 5.5 einen festen Satz behalten
Die Stufe ist ein Sprung, keine Steigung: Ein Token über 100K bepreist die gesamte Anfrage neu.

Was das in der Praxis bedeutet:

  • Pipelines für lange Dokumente sollten unter 100K chunken. Zählen Sie den gesamten Prompt – System-Prompt, Anweisungen, Tool-Definitionen und Dokument –, nicht nur das Dokument. Allein das Browser-Toolset bringt rund 6.600 Tokens mit.
  • Zählen Sie Tokens mit dem neuen Modell. Ein Prompt, den Sie bei Haiku 4.5 mit 85K gemessen haben, liegt bei Haiku 5.5 bei rund 110K. Nutzen Sie den Token-Counting-Endpunkt mit model: "claude-haiku-5-5".
  • Langer Kontext bleibt günstig – nur nicht 20× günstig. Oberhalb der Grenze kostet Haiku 5.5 0,50 $ / 2,50 $, immer noch ein Viertel von Sonnet 5.5.

Was drei reale Workloads pro Monat kosten

Listenpreise zählen erst über einen Workload. Hier sind drei typische, gerechnet zu Listenpreisen auf der Claude API. Die Token-Zahlen sind illustrativ und auf den neueren Tokenizer bezogen; für Haiku 4.5 habe ich sie durch 1,3 geteilt, um seinen älteren Tokenizer zu berücksichtigen. Ihr Mix wird anders aussehen, die Verhältnisse bleiben.

1. Eine Million Support-Tickets klassifizieren. Ein gecachter System-Prompt mit 2.000 Tokens und den Kategoriedefinitionen, ein Ticket mit 400 Tokens und eine Antwort mit 30 Tokens über einen erzwungenen Tool-Aufruf – der bei Haiku 5.5 keinen Thinking-Block liefert.

Was drei reale Workloads pro Monat kosten
Modell Cache Reads Input Output Pro Monat
Haiku 5.5 20 $ 40 $ 15 $ 75 $
Haiku 5.5, Batch API 10 $ 20 $ 7,50 $ 37,50 $
Haiku 4.5 (Prompt zu kurz zum Cachen) – 1.846 $ 115 $ 1.962 $
Sonnet 5.5 200 $ 800 $ 300 $ 1.300 $
Opus 5.5 400 $ 1.600 $ 600 $ 2.600 $

In dieser Tabelle stecken zwei Details. Erstens kann Haiku 4.5 diesen Prompt gar nicht cachen: Sein minimaler cachebarer Präfix liegt bei 4.096 Tokens, Haiku 5.5, Sonnet 5.5 und Opus 5.5 cachen ab 512. Den Haiku-4.5-Prompt über das Minimum aufzufüllen, brächte ihn auf rund 833 $ – immer noch das 11-Fache der Haiku-5.5-Rechnung. Zweitens schönt die Tabelle Sonnet und Opus: Sonnet 5.5 lehnt ein erzwungenes tool_choice ab, und Opus 5.5 denkt immer, beide würden also zusätzliche Thinking-Tokens als Output abrechnen. Trotzdem ist Haiku 5.5 hier 17-mal günstiger als Sonnet. In der Batch API sind Cache-Treffer nicht garantiert, betrachten Sie diese Zeile also als Untergrenze. Ob ein Frontier-Modell für Klassifizierung überhaupt das richtige Werkzeug ist, habe ich in Jev vs. GPT-5 und Claude für Klassifizierung und Routing untersucht.

2. 10.000 lange Dokumente zusammenfassen. Jedes Dokument hat 150K Tokens, die Zusammenfassung 2K Tokens.

Was drei reale Workloads pro Monat kosten
Ansatz Pro Dokument Pro Monat
Haiku 5.5, eine Anfrage (über 100K) 0,0800 $ 800 $
Haiku 5.5, zwei Chunks à 75K + Merge-Anfrage 0,0172 $ 172 $
Haiku 4.5, eine Anfrage 0,1231 $ 1.231 $
Sonnet 5.5, eine Anfrage 0,32 $ 3.200 $
Opus 5.5, eine Anfrage 0,64 $ 6.400 $

Chunking unterhalb der Stufe macht denselben Job etwa 4,7-mal günstiger. Der Preis dafür: Kein einzelner Aufruf sieht das ganze Dokument – für Zusammenfassungen und Extraktion in Ordnung, für Fragen, die Reasoning über das ganze Dokument brauchen, falsch.

3. Tausend Agent-Aufgaben mit Subagents. Pro Aufgabe liest ein Orchestrator 40K Tokens und schreibt 4K, um zu planen und zusammenzuführen; danach lesen 20 Subagents je 30K Tokens Code und schreiben je 1,5K, Thinking inklusive. Der Orchestrator ist in jeder Zeile Opus 5.5, nur die Subagents wechseln.

Was drei reale Workloads pro Monat kosten
Subagent-Modell Subagents pro Aufgabe Aufgabe gesamt Pro Monat
Opus 5.5 3,00 $ 3,24 $ 3.240 $
Sonnet 5.5 1,50 $ 1,74 $ 1.740 $
Haiku 5.5 0,075 $ 0,315 $ 315 $

Zehnmal günstiger als reines Opus – sofern die Teilaufgaben eng genug geschnitten sind für ein Modell, das bei Terminal-Bench 39,2 % erreicht. Diese Bedingung ist das eigentliche Designproblem, und darum geht es im nächsten Abschnitt.

Opus plant, Haiku führt aus – ohne das Reasoning zu verlieren

Das Muster, das Anthropic mit diesem Release verkauft, ist ein größeres Modell, das plant und Teilaufgaben an viele parallele Haiku-5.5-Subagents verteilt. Seit Claude Fable 5.1 schränkt Anthropic ein, welche Modelle das Preserved Thinking anderer Modelle lesen dürfen – vor allem als Schutz gegen Distillation. Wie Sie Modelle verdrahten, ist deshalb wichtig:

  • Thinking fließt von Haiku 5.5 nach oben. Auf der Claude API und Google Cloud lesen Sonnet 5.5 und Opus 5.5 die Thinking-Blöcke von Haiku 5.5. Eine Konversation, die günstig auf Haiku startet und zu Sonnet oder Opus eskaliert, behält ihr Reasoning. Auf anderen Plattformen sieht das größere Modell nur Haikus Text und Tool-Aufrufe.
  • Der Weg zurück nach unten verwirft das Reasoning. Laut Doku liest nur Opus 5.5 das Thinking von Sonnet 5.5, und das Thinking von Opus 5.5 lesen nur Fable 5.1 und Mythos 5.1. Ein Turn, der zurück zu Haiku geroutet wird, läuft ohne das Reasoning des größeren Modells – still, mit HTTP 200, genau wie bei der Routing-Falle zwischen Sonnet und Opus.
  • Thinking ist an das Konto gebunden. Die Thinking-Blöcke von Haiku 5.5 funktionieren nur in dem Konto, das sie erzeugt hat, oder in einem damit verknüpften. Ein gemeinsamer Konversationsspeicher, der Sessions über den Schlüssel eines anderen Kunden abspielt, verliert sie.
  • Der Verlauf muss append-only bleiben. Bei Konten, die am oder nach dem 31. August 2026 angelegt wurden, liefert jede Änderung an system, tools oder früheren Nachrichten vor einem Haiku-5.5-Thinking-Block einen 400-Fehler.
Opus 5.5 plant und verteilt abgegrenzte Teilaufgaben an Haiku-5.5-Subagents in frischen Konversationen; die Eskalation von Haiku zu Sonnet oder Opus behält das Thinking auf der Claude API und Google Cloud, das Zurückrouten zu Haiku verwirft das Thinking des größeren Modells
Subagents starten frisch, also geht nichts verloren. Eskalation behält das Reasoning nur in eine Richtung.

Das Subagent-Muster umgeht all das, weil jeder Subagent eine frische Konversation ist: Der Orchestrator schreibt ein Task-Briefing, der Subagent arbeitet es ab, das Ergebnis kommt als Text zurück. Nichts wird modellübergreifend erneut abgespielt, also geht nichts verloren. Was tatsächlich darüber entscheidet, ob es funktioniert:

  • Briefen Sie wie einen Junior-Engineer. Eingaben, exaktes Ausgabeformat, Abnahmekriterien und was nicht angefasst werden darf. Bei FrontierCode – abgegrenzte, mergebare Änderungen – kommt Haiku 5.5 Sonnet am nächsten.
  • Halten Sie den Prompt jedes Subagents unter 100K. Zwanzig Subagents über der Grenze kosten jeweils das Fünffache.
  • Prüfen Sie im Orchestrator, nicht im Subagent. Lassen Sie den Planer Ergebnisse kontrollieren und neu vergeben, statt dass sich ein Subagent selbst abnimmt.

Wenn Sie ohnehin mit einem Coding-Agent arbeiten, ist das dieselbe Idee wie dessen eigene Subagents; wie Claude Code, Codex und opencode diese Arbeit strukturieren, steht in KI-Coding-Agents: Claude Code vs. Codex vs. opencode.

Migration von Haiku 4.5: Was bricht

Die Launch-Kommunikation nennt Haiku 5.5 für die meisten Integrationen einen Drop-in-Ersatz. Der Migrationsleitfaden ist präziser – diese Dinge liefern Fehler:

Migration von Haiku 4.5: Was bricht
Was Sie heute an Haiku 4.5 senden Bei Haiku 5.5 Lösung
claude-haiku-4-5 / claude-haiku-4-5-20251001 falsches Modell claude-haiku-5-5 (ohne Datumssuffix, kein separater Alias)
thinking: {"type": "enabled", "budget_tokens": N} 400-Fehler {"type": "adaptive"} plus output_config.effort
temperature, top_p oder top_k abweichend vom Standard 400-Fehler Weglassen; über den Prompt steuern
Ein abschließender Assistant-Turn als Prefill 400-Fehler Mit einem User-Turn enden; Format über Structured Outputs oder Tools
computer_20250124 auf der Claude API oder Google Cloud 400-Fehler computer_toolset_20260801
Frühere Turns bearbeiten und Thinking zurücksenden 400 bei Konten ab dem 31. August 2026 Verlauf append-only halten

Und Änderungen, die keine Anfrage scheitern lassen, aber Ergebnisse oder Rechnung verändern:

  • Antworten können mit Thinking-Blöcken beginnen. Adaptives Thinking ist standardmäßig aktiv. Code, der content[0].text liest, bricht; wählen Sie Blöcke nach type.
  • Thinking zählt zu max_tokens. Ein kleines Limit, das für Haiku 4.5 abgestimmt war, kann nach dem Thinking-Block ganz ohne Text enden.
  • Der Thinking-Text ist standardmäßig leer. Haiku 4.5 lieferte zusammengefasstes Thinking; Haiku 5.5 liefert nur eine Signatur, außer Sie setzen display: "summarized".
  • Derselbe Text ergibt rund 30 % mehr Tokens. Prompts neu zählen, Budgets neu rechnen – und die 100K-Grenze erneut prüfen.
  • Kein Priority Tier. Wer bei Haiku 4.5 eine Priority-Tier-Zusage hat, muss die Kapazität separat planen.

Eine minimale Klassifizierungsanfrage, die auf Haiku 5.5 so funktioniert:

response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=1024,
output_config={"effort": "low"}, # für nicht erzwungene Aufrufe; ein erzwungener Tool-Aufruf überspringt Thinking
system=[{
"type": "text",
"text": CATEGORY_RULES, # zusammen mit dem Ticket unter 100K halten
"cache_control": {"type": "ephemeral"}, # Breakpoint auf dem statischen Teil, nicht dem Ticket
}],
tools=[classify_tool], # input_schema mit Enum der Kategorien
tool_choice={"type": "tool", "name": "classify"}, # erzwungen: kein Thinking-Block
messages=[{"role": "user", "content": ticket_text}], # kein Assistant-Prefill
)
if response.stop_reason == "refusal": # kein serverseitiger Fallback bei Haiku 5.5
route_to_human(ticket_text)
else:
label = next(b.input for b in response.content if b.type == "tool_use")

Ein Caching-Detail, das still Geld kostet: Nutzen Sie hier kein automatisches Caching auf oberster Ebene. Es setzt den Breakpoint auf den letzten Block – das Ticket, das sich bei jeder Anfrage ändert –, und der Cache trifft nie. Markieren Sie stattdessen den statischen System-Block und halten Sie tools, tool_choice und effort über alle Anfragen gleich, denn Änderungen daran invalidieren den Cache.

Am schnellsten durch eine echte Codebasis kommen Sie mit dem mitgelieferten Claude-API-Skill in Claude Code:

/claude-api migrate this project to claude-haiku-5-5

Refusals ohne Fallback

Haiku 5.5 bringt Schutzmechanismen für Cyber und Biologie mit. Anthropic beschreibt die Cyber-Schutzmechanismen als strenger als bei Haiku 4.5, aber lockerer als bei anderen aktuellen Modellen: Sie erlauben mehr defensive Aufgaben als bei Sonnet 5.5 und blockieren weiterhin Penetrationstests und andere Techniken, die eher von Angreifern genutzt werden. Die Biologie-Schutzmechanismen entsprechen Sonnet 5, Sonnet 5.5 und Opus 5.

Für Engineering-Teams zählt die Verdrahtung: Eine abgelehnte Anfrage liefert stop_reason: "refusal", und es gibt keinen serverseitigen Fallback – die Arbeit läuft nicht auf einem anderen Modell weiter. Eine Pipeline, die eine Million Einträge verarbeitet, braucht dafür einen expliziten Zweig. Teams mit autorisierter offensiver Sicherheitsarbeit können sich für das Cyber Verification Program bewerben, um weniger Blockierungen zu bekommen.

Welches Modell wofür?

  • Haiku 5.5 auf low – Klassifizierung, Routing, Extraktion, Tagging, Moderations-Vorfilter, Compaction und erste Durchsicht von Dokumenten. Erzwingen Sie den Tool-Aufruf, wenn die Ausgabe ein Label ist. Nutzen Sie die Batch API, wann immer das Ergebnis nicht in Echtzeit gebraucht wird.
  • Haiku 5.5 auf medium – Live-Kundensupport, In-App-Assistenten und Browser Use, wo Geschwindigkeit am meisten zählt und die Aufgabe klar definiert ist.
  • Haiku 5.5 als Subagent – abgegrenzte Coding- und Recherche-Teilaufgaben unter einem Planer auf Opus 5.5 oder Sonnet 5.5, jeweils in einer frischen Konversation unter 100K Tokens.
  • Sonnet 5.5 – Ihr Standard für agentisches Coding und allgemeine Arbeit. Durch den halbierten Cache-Read-Preis ist es bei agentischer Arbeit jetzt rund 20 % günstiger; die Abwägung gegenüber Opus steht in Sonnet 5.5 vs. Opus 5.5.
  • Opus 5.5 – mehrdeutige Langzeitaufgaben und der Planer-Platz in einem Multi-Agent-System. Wer zusätzlich OpenAIs Mittelklasse-Modell abwägt, findet den Vergleich in GPT-6.1 Sol vs. Claude Opus 5.5.

Fazit

Haiku 5.5 ist das erste kleine Claude-Modell, das Architekturentscheidungen verändert, nicht nur Rechnungen. Zu einem Zwanzigstel von Sonnets Preis bewältigt es Computer Use, Extraktion in der Wissensarbeit und abgegrenztes Coding gut genug, dass viel Traffic, der heute auf Sonnet läuft, nach unten wandern kann – und fast alles, was noch auf Haiku 4.5 läuft, sollte wechseln.

Aber es ist ein Spezialist, und es hat eine Preisregel, die kein anderes aktuelles Claude-Modell hat. Halten Sie Prompts unter 100.000 Tokens, erzwingen Sie Tool-Aufrufe für Labels, geben Sie Subagents frische Konversationen mit knappen Briefings, und lassen Sie Thinking nach oben zu Sonnet oder Opus fließen – zurück nach unten fließt es nie.

Häufig gestellte Fragen

Ist Claude Haiku 5.5 besser als Sonnet 5.5?

Nein, und das soll es auch nicht sein. In Anthropics Tabelle erreicht Haiku 5.5 bei OSWorld 2.1 (Offline-Subset) 72,4 % gegenüber 83,9 % für Sonnet 5.5, bei FrontierCode 46,4 % gegenüber 52,1 % und bei Terminal-Bench 4.0 39,2 % gegenüber 70,6 %. Es kostet ein Zwanzigstel von Sonnets Listenpreis und ist Anthropics schnellstes Modell. Anthropic selbst schreibt, dass Sonnet 5.5 und Opus 5.5 für komplexes agentisches Coding die bessere Wahl bleiben, und positioniert Haiku 5.5 für eng umrissene Aufgaben wie Compaction, Zusammenfassungen, Klassifizierung und Subagent-Arbeit.

Was kostet Claude Haiku 5.5?

Für Prompts bis 100.000 Tokens: 0,10 $ pro Million Input-Tokens, 0,50 $ pro Million Output-Tokens, 0,01 $ für Cache Reads, 0,125 $ für 5-Minuten-Cache-Writes und 0,20 $ für 1-Stunden-Cache-Writes. Für Prompts über 100.000 Tokens ist jeder Preis fünfmal so hoch: 0,50 $ / 2,50 $, Cache Reads 0,05 $. Die Batch API ist 50 % günstiger, kurze Prompts kosten dort 0,05 $ / 0,25 $. Haiku 4.5 kostete 1 $ / 5 $.

Was bricht bei der Migration von Claude Haiku 4.5 auf Haiku 5.5?

Die Modell-ID wird zu claude-haiku-5-5. Manuelles Extended Thinking mit budget_tokens, nicht standardmäßige Werte für temperature, top_p oder top_k, ein Assistant-Prefill und das Tool computer_20250124 auf der Claude API und Google Cloud liefern 400-Fehler. Antworten können mit Thinking-Blöcken beginnen, der Thinking-Text ist standardmäßig leer, Thinking-Tokens zählen zu max_tokens, derselbe Text ergibt rund 30 % mehr Tokens, und Priority Tier wird nicht unterstützt. Behandeln Sie stop_reason refusal, denn es gibt keinen serverseitigen Fallback.

Taugt Claude Haiku 5.5 zum Programmieren?

Für klar umrissene Coding-Aufgaben und Subagent-Arbeit ja; für lange agentische Coding-Sessions sind Sonnet 5.5 oder Opus 5.5 weiterhin besser. Haiku 5.5 sprang bei Terminal-Bench 4.0 von 0,0 % auf 39,2 % und erreicht bei FrontierCode 1.1 46,4 %, nah an Sonnet 5.5 mit 52,1 % auf xhigh. Ein verbreitetes Muster ist ein Orchestrator auf Opus 5.5 oder Sonnet 5.5, der plant und klar definierte Teilaufgaben an Haiku-5.5-Subagents verteilt.

Wie mache ich Claude Haiku 5.5 so schnell und günstig wie möglich?

Setzen Sie output_config.effort auf low, denn adaptives Thinking ist standardmäßig aktiv und Thinking-Tokens werden als Output abgerechnet. Bis einschließlich high können Sie Thinking mit thinking type disabled ganz abschalten. Für Klassifizierung eignet sich ein erzwungenes tool_choice mit einem Enum-Feld: Haiku 5.5 akzeptiert es, und die Antwort beginnt direkt mit dem Tool-Aufruf ohne Thinking-Block. Halten Sie Prompts unter 100.000 Tokens und nutzen Sie die Batch API für alles, was nicht in Echtzeit laufen muss.

Aus der Community

Diskussion auf Mastodon & Bluesky

Antworten auf diesen Artikel aus dem offenen Netz, live geladen. Keine Werbung, keine Tracking-Skripte.

Antworten werden geladen …
Auf Mastodon antwortenAuf Bluesky antworten

Antworte dort — es erscheint hier automatisch.

ENDE