---
title: "Claude Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5: 20× günstiger als Sonnet – mit einer Preisstufe bei 100K Tokens"
description: "Claude Haiku 5.5, Sonnet 5.5 und Opus 5.5 im Vergleich: Anthropics Benchmarks, Listenpreise und Monatskosten für drei reale Workloads, die Preisstufe bei 100.000 Tokens, die nur Haiku hat, was bei der Migration von Haiku 4.5 bricht und wie Opus plant, während Haiku die Arbeit erledigt."
author: Aleksei Aleinikov
date: 2026-10-08
lang: de
tags: [claude-haiku-5-5, claude-sonnet-5-5, claude-opus-5-5, anthropic-pricing, llm-cost-optimization, llm-model-routing]
canonical: https://www.alekseialeinikov.com/de/blog/topics/ai/claude-haiku-5-5-vs-sonnet-5-5-vs-opus-5-5-vergleich
source: alekseialeinikov.com
---

# Claude Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5: 20× günstiger als Sonnet – mit einer Preisstufe bei 100K Tokens

Anthropic hat [Claude Haiku 5.5](https://www.anthropic.com/claude-haiku-5-5) am 7. Oktober veröffentlicht, und zwei Zahlen aus dem Launch-Beitrag werden die meiste Aufmerksamkeit bekommen: ein Preis und ein Sprung. Der Preis: **0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens**, ein Zwanzigstel von Sonnet 5.5. Der Sprung: Bei Terminal-Bench 4.0, einem Benchmark für agentisches Coding, kam Haiku 4.5 auf **0,0 %**, Haiku 5.5 auf **39,2 %**.

Die naheliegende Lesart lautet „ein billiges Sonnet“. Das ist es nicht, und wer es so behandelt, zahlt zu viel oder liefert schlechtere Ergebnisse. Dieser Leitfaden vergleicht Haiku 5.5 mit Sonnet 5.5 und Opus 5.5 anhand von Anthropics veröffentlichten Zahlen, rechnet aus, was drei reale Workloads pro Monat auf jedem Modell kosten, und erklärt die eine Preisregel, die nur Haiku hat: Ab 100.000 Tokens kostet dieselbe Anfrage das Fünffache.

![Claude Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5: 0,10 $ vs. 2 $ vs. 4 $ pro Million Input-Tokens, Terminal-Bench-4.0-Werte und eine 5-fache Preisstufe für Prompts über 100K Tokens](https://www.alekseialeinikov.com/blog/haiku-5-5-vs-sonnet-opus.webp)

## Haiku 5.5 vs. Sonnet 5.5 vs. Opus 5.5 auf einen Blick

Die Angaben stammen von der [Modellseite zu Haiku 5.5](https://platform.claude.com/docs/en/models/haiku-5-5/overview), der [Modellübersicht](https://platform.claude.com/docs/en/about-claude/models/overview) und der [Preisseite](https://platform.claude.com/docs/en/about-claude/pricing).

| | **Claude Haiku 5.5** | **Claude Sonnet 5.5** | **Claude Opus 5.5** |
|---|---|---|---|
| API-Modell-ID | `claude-haiku-5-5` | `claude-sonnet-5-5` | `claude-opus-5-5` |
| Input / Output pro Million Tokens | **0,10 $ / 0,50 $** (Prompts ≤ 100K) | 2 $ / 10 $ | 4 $ / 20 $ |
| Prompts über 100K Tokens | **0,50 $ / 2,50 $** | unverändert | unverändert |
| Cache Read pro Million Tokens | **0,01 $** (0,05 $ über 100K) | 0,10 $ | 0,20 $ |
| Batch API Input / Output | 0,05 $ / 0,25 $ | 1 $ / 5 $ | 2 $ / 10 $ |
| Kontextfenster / max. Output | 1M / 128K | 1M / 128K | 1M / 128K |
| Thinking | Adaptiv; abschaltbar | Adaptiv; Minimum `between_tools` | Adaptiv, immer aktiv |
| Standard-Effort auf der Claude API | `medium` | `high` | `medium` |
| Relative Latenz | **Am schnellsten** | Schnell | Mittel |
| Wissensstand | Juni 2026 | Juni 2026 | Juni 2026 |
| Anthropics eigene Beschreibung | „Für hochvolumige, latenzkritische Aufgaben wie Klassifizierung, Extraktion und Routing“ | „Die beste Kombination aus Geschwindigkeit und Intelligenz“ | „Für langlaufendes agentisches Coding und Wissensarbeit“ |

Drei Zeilen verdienen einen zweiten Blick:

- **Cache Reads kosten bei Haiku 10 % des Inputs, bei Sonnet und Opus 5 %.** Am Launch-Tag von Haiku 5.5 hat Anthropic außerdem den Cache-Read-Preis von Sonnet 5.5 auf 0,10 $ halbiert, was Sonnet 5.5 laut Anthropic bei den meisten agentischen Aufgaben rund 20 % günstiger macht. Haikus Cache Read ist trotzdem zehnmal billiger als der von Sonnet. Warum Cache Reads Agent-Rechnungen dominieren, steht in [der Cache-Read-Regel bei den Preisen von Fable und Mythos](https://www.alekseialeinikov.com/de/blog/topics/ai/claude-fable-mythos-preise-cache-read-regel).
- **Nur Haiku 5.5 wird nach Prompt-Länge abgerechnet.** Die anderen beiden verlangen von 9K bis 900K Tokens denselben Preis pro Token. Dazu unten mehr, denn das verändert, wie Sie Pipelines für lange Dokumente bauen sollten.
- **Der Standard-Effort unterscheidet sich wieder.** Haiku und Opus starten mit `medium`, Sonnet mit `high`. Setzen Sie `output_config.effort` in jedem A/B-Test explizit.

Haiku 5.5 gibt es auf der Claude API, Amazon Bedrock (`anthropic.claude-haiku-5-5`), Google Cloud, Microsoft Foundry und Claude Platform on AWS. Zusätzlich führt Anthropic monatliche API-Guthaben für Max- und Team-Abos ein – 100 $ bei Max 5x, 200 $ bei Max 20x und bis zu 500 $ gepoolt bei Team, nutzbar für jedes Modell. Das reicht, um jedes Muster aus diesem Artikel als Prototyp zu testen, bevor echter Traffic darauf läuft.

## Die Benchmarks: ein riesiger Sprung und eine klare Decke

Das sind die Zahlen aus Anthropics Launch-Beitrag. Die Tabelle dort vergleicht Haiku 5.5 mit Haiku 4.5, OpenAIs GPT-6 Luna und Sonnet 5.5. OSWorld bezieht sich hier auf das Offline-Subset und ist daher nicht direkt mit den 80,1 % vergleichbar, die Sonnet 5.5 im eigenen Launch-Beitrag auf dem vollständigen Benchmark erreichte.

| Benchmark | **Haiku 5.5** | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (agentisches Coding im Terminal) | **39,2 %** | 0,0 % | 16,4 % | 70,6 % |
| FrontierCode 1.1 Main (mergebare Änderungen) | **46,4 %** | – | 42,4 % | 52,1 % auf xhigh |
| OSWorld 2.1, Offline-Subset (Computer Use) | **72,4 %** | 15,7 % | 48,9 % | 83,9 % |
| GDPval-AA v2.1 (Wissensarbeit, Elo) | **1620** | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Wissensarbeit, Elo) | **1578** | 614 | 1336 | 1824 |
| Humanity's Last Exam, ohne / mit Tools | **45,9 % / 57,4 %** | 10,2 % / 18,7 % | – | 56,9 % / 64,5 % |
| Chartography, ohne Tools (visuelles Reasoning) | **46,4 %** | 6,4 % | 29,1 % | 61,6 % |

![Benchmark-Vergleich von Claude Haiku 4.5, Haiku 5.5 und Sonnet 5.5: Haiku 5.5 erreicht 86 % von Sonnets OSWorld-Wert, aber nur 56 % seines Terminal-Bench-4.0-Werts, zu einem Zwanzigstel des Preises](https://www.alekseialeinikov.com/blog/haiku-5-5-vs-sonnet-opus-benchmarks.webp "Bei Computer Use und Wissensarbeit schließt Haiku 5.5 den Großteil der Lücke. Bei langem agentischem Coding etwa die Hälfte.")

Drei Dinge lassen sich aus der Tabelle ablesen:

1. **Computer Use ist die Überraschung.** 72,4 % bei OSWorld sind 86 % von Sonnets Wert zu 5 % seines Preises, und Haiku 5.5 ist bei Standardgeschwindigkeit Anthropics schnellstes Modell. Deshalb positioniert Anthropic es für Live-Kundensupport und Browser Use, und deshalb unterstützt das neue [Browser-Use-Tool](https://platform.claude.com/docs/en/agents-and-tools/tool-use/browser-use-tool) Haiku 5.5 (Haiku 4.5 nicht). Das Toolset fügt jeder Anfrage rund 6.600 Input-Tokens hinzu – 0,00066 $ bei Haiku, 0,0132 $ bei Sonnet.
2. **Bei langem agentischem Coding zeigt sich die Decke.** 39,2 % gegenüber 70,6 % bei Terminal-Bench sind etwa die Hälfte von Sonnets Wert. Anthropic sagt das offen: Sonnet 5.5 und Opus 5.5 bleiben für komplexes agentisches Coding die bessere Wahl, Haiku 5.5 eignet sich für eng umrissene Aufgaben wie Compaction, Zusammenfassungen oder Subagent-Arbeit. FrontierCode, das abgegrenzte, mergebare Änderungen belohnt, liegt deutlich näher: 46,4 % gegenüber 52,1 %.
3. **Die eigentliche Geschichte ist der Sprung gegenüber Haiku 4.5.** GDPval-AA hat sich mehr als verdoppelt, OSWorld stieg von 15,7 % auf 72,4 %. Das Kontextfenster wächst von 200K auf 1M Tokens, der maximale Output von 64K auf 128K, und es ist das erste Haiku mit einstellbarem Effort. Wer heute Haiku 4.5 einsetzt, bekommt ein Upgrade – offen ist nur, wie viel Sonnet-Traffic mit nach unten wandern kann.

Hinter dem Tempo-Versprechen steht eine erste Kundenzahl: Asana hat Haiku 5.5 mit seinem Agenten AI Teammates getestet und gegenüber dem aktuell eingesetzten Modell mehr als 30 % geringere Latenz bis zum Abschluss einer Aufgabe und bis zu 2,5-mal schnellere Inferenz pro Agent-Turn gemessen.

Wie immer gilt: Das sind Herstellerangaben. Nutzen Sie sie als Karte dafür, wo Sie eigene Evals fahren, nicht als Ersatz dafür.

## Die 100K-Stufe: Haikus Preis hängt von der Prompt-Länge ab

Die [Preisseite](https://platform.claude.com/docs/en/about-claude/pricing#long-context-pricing) sagt es deutlich: Claude 4.6 und neuere Modelle berechnen über das gesamte 1M-Kontextfenster denselben Preis – **außer Claude Haiku 5.5**, das nach Prompt-Länge abgerechnet wird: Ein Prompt mit mehr als 100.000 Tokens zahlt höhere Preise.

| Haiku-5.5-Preis pro Million Tokens | Prompt ≤ 100K Tokens | Prompt > 100K Tokens |
|---|---|---|
| Input | 0,10 $ | 0,50 $ |
| Output | 0,50 $ | 2,50 $ |
| 5-Minuten-Cache-Write | 0,125 $ | 0,625 $ |
| 1-Stunden-Cache-Write | 0,20 $ | 1,00 $ |
| Cache Read | 0,01 $ | 0,05 $ |
| Batch Input / Output | 0,05 $ / 0,25 $ | 0,25 $ / 1,25 $ |

Jeder Preis steigt um das Fünffache – auch der Output. Ein Prompt mit 99K Tokens kostet rund 0,0099 $ Input, einer mit 101K Tokens rund 0,0505 $. Laut Anthropic lagen etwa 90 % der Haiku-4.5-Anfragen unter 100K. Deshalb nennt Anthropic im Schnitt „rund 75 % weniger“ statt der 90 %, die der Listenpreis für kurze Prompts nahelegt. Der andere Teil der Differenz ist der Tokenizer: Haiku 5.5 nutzt den neueren Tokenizer, der mit Claude Opus 4.7 eingeführt wurde, und derselbe Text ergibt rund 30 % mehr Tokens als bei Haiku 4.5. Nach der Faustregel der Doku von etwa 555.000 englischen Wörtern pro Million Tokens entsprechen 100K Tokens rund 55.000 Wörtern Englisch; deutscher Text braucht pro Wort meist mehr Tokens.

![Die 100K-Preisstufe bei Claude Haiku 5.5: Die Input-Kosten pro Anfrage steigen linear bis 0,01 $ bei 100K Tokens, springen dann um das Fünffache auf etwa 0,05 $ und steigen mit dem höheren Satz weiter, während Sonnet 5.5 und Opus 5.5 einen festen Satz behalten](https://www.alekseialeinikov.com/blog/haiku-5-5-vs-sonnet-opus-cliff.webp "Die Stufe ist ein Sprung, keine Steigung: Ein Token über 100K bepreist die gesamte Anfrage neu.")

Was das in der Praxis bedeutet:

- **Pipelines für lange Dokumente sollten unter 100K chunken.** Zählen Sie den gesamten Prompt – System-Prompt, Anweisungen, Tool-Definitionen und Dokument –, nicht nur das Dokument. Allein das Browser-Toolset bringt rund 6.600 Tokens mit.
- **Zählen Sie Tokens mit dem neuen Modell.** Ein Prompt, den Sie bei Haiku 4.5 mit 85K gemessen haben, liegt bei Haiku 5.5 bei rund 110K. Nutzen Sie den [Token-Counting-Endpunkt](https://platform.claude.com/docs/en/build-with-claude/token-counting) mit `model: "claude-haiku-5-5"`.
- **Langer Kontext bleibt günstig – nur nicht 20× günstig.** Oberhalb der Grenze kostet Haiku 5.5 0,50 $ / 2,50 $, immer noch ein Viertel von Sonnet 5.5.

## Was drei reale Workloads pro Monat kosten

Listenpreise zählen erst über einen Workload. Hier sind drei typische, gerechnet zu Listenpreisen auf der Claude API. Die Token-Zahlen sind illustrativ und auf den neueren Tokenizer bezogen; für Haiku 4.5 habe ich sie durch 1,3 geteilt, um seinen älteren Tokenizer zu berücksichtigen. Ihr Mix wird anders aussehen, die Verhältnisse bleiben.

**1. Eine Million Support-Tickets klassifizieren.** Ein gecachter System-Prompt mit 2.000 Tokens und den Kategoriedefinitionen, ein Ticket mit 400 Tokens und eine Antwort mit 30 Tokens über einen erzwungenen Tool-Aufruf – der bei Haiku 5.5 keinen Thinking-Block liefert.

| Modell | Cache Reads | Input | Output | **Pro Monat** |
|---|---|---|---|---|
| Haiku 5.5 | 20 $ | 40 $ | 15 $ | **75 $** |
| Haiku 5.5, Batch API | 10 $ | 20 $ | 7,50 $ | **37,50 $** |
| Haiku 4.5 (Prompt zu kurz zum Cachen) | – | 1.846 $ | 115 $ | 1.962 $ |
| Sonnet 5.5 | 200 $ | 800 $ | 300 $ | 1.300 $ |
| Opus 5.5 | 400 $ | 1.600 $ | 600 $ | 2.600 $ |

In dieser Tabelle stecken zwei Details. Erstens kann Haiku 4.5 diesen Prompt gar nicht cachen: Sein [minimaler cachebarer Präfix](https://platform.claude.com/docs/en/build-with-claude/prompt-caching#cache-limitations) liegt bei 4.096 Tokens, Haiku 5.5, Sonnet 5.5 und Opus 5.5 cachen ab 512. Den Haiku-4.5-Prompt über das Minimum aufzufüllen, brächte ihn auf rund 833 $ – immer noch das 11-Fache der Haiku-5.5-Rechnung. Zweitens schönt die Tabelle Sonnet und Opus: Sonnet 5.5 lehnt ein erzwungenes `tool_choice` ab, und Opus 5.5 denkt immer, beide würden also zusätzliche Thinking-Tokens als Output abrechnen. Trotzdem ist Haiku 5.5 hier 17-mal günstiger als Sonnet. In der Batch API sind Cache-Treffer nicht garantiert, betrachten Sie diese Zeile also als Untergrenze. Ob ein Frontier-Modell für Klassifizierung überhaupt das richtige Werkzeug ist, habe ich in [Jev vs. GPT-5 und Claude für Klassifizierung und Routing](https://www.alekseialeinikov.com/de/blog/topics/ai/jev-vs-gpt-5-claude-klassifizierung-routing) untersucht.

**2. 10.000 lange Dokumente zusammenfassen.** Jedes Dokument hat 150K Tokens, die Zusammenfassung 2K Tokens.

| Ansatz | Pro Dokument | **Pro Monat** |
|---|---|---|
| Haiku 5.5, eine Anfrage (über 100K) | 0,0800 $ | **800 $** |
| Haiku 5.5, zwei Chunks à 75K + Merge-Anfrage | 0,0172 $ | **172 $** |
| Haiku 4.5, eine Anfrage | 0,1231 $ | 1.231 $ |
| Sonnet 5.5, eine Anfrage | 0,32 $ | 3.200 $ |
| Opus 5.5, eine Anfrage | 0,64 $ | 6.400 $ |

Chunking unterhalb der Stufe macht denselben Job etwa 4,7-mal günstiger. Der Preis dafür: Kein einzelner Aufruf sieht das ganze Dokument – für Zusammenfassungen und Extraktion in Ordnung, für Fragen, die Reasoning über das ganze Dokument brauchen, falsch.

**3. Tausend Agent-Aufgaben mit Subagents.** Pro Aufgabe liest ein Orchestrator 40K Tokens und schreibt 4K, um zu planen und zusammenzuführen; danach lesen 20 Subagents je 30K Tokens Code und schreiben je 1,5K, Thinking inklusive. Der Orchestrator ist in jeder Zeile Opus 5.5, nur die Subagents wechseln.

| Subagent-Modell | Subagents pro Aufgabe | Aufgabe gesamt | **Pro Monat** |
|---|---|---|---|
| Opus 5.5 | 3,00 $ | 3,24 $ | **3.240 $** |
| Sonnet 5.5 | 1,50 $ | 1,74 $ | **1.740 $** |
| Haiku 5.5 | 0,075 $ | 0,315 $ | **315 $** |

Zehnmal günstiger als reines Opus – **sofern** die Teilaufgaben eng genug geschnitten sind für ein Modell, das bei Terminal-Bench 39,2 % erreicht. Diese Bedingung ist das eigentliche Designproblem, und darum geht es im nächsten Abschnitt.

## Opus plant, Haiku führt aus – ohne das Reasoning zu verlieren

Das Muster, das Anthropic mit diesem Release verkauft, ist ein größeres Modell, das plant und Teilaufgaben an viele parallele Haiku-5.5-Subagents verteilt. Seit Claude Fable 5.1 schränkt Anthropic ein, welche Modelle das [Preserved Thinking](https://platform.claude.com/docs/en/build-with-claude/preserved-thinking) anderer Modelle lesen dürfen – vor allem als Schutz gegen Distillation. Wie Sie Modelle verdrahten, ist deshalb wichtig:

- **Thinking fließt von Haiku 5.5 nach oben.** Auf der Claude API und Google Cloud lesen Sonnet 5.5 und Opus 5.5 die Thinking-Blöcke von Haiku 5.5. Eine Konversation, die günstig auf Haiku startet und zu Sonnet oder Opus eskaliert, behält ihr Reasoning. Auf anderen Plattformen sieht das größere Modell nur Haikus Text und Tool-Aufrufe.
- **Der Weg zurück nach unten verwirft das Reasoning.** Laut Doku liest nur Opus 5.5 das Thinking von Sonnet 5.5, und das Thinking von Opus 5.5 lesen nur Fable 5.1 und Mythos 5.1. Ein Turn, der zurück zu Haiku geroutet wird, läuft ohne das Reasoning des größeren Modells – still, mit HTTP 200, genau wie bei [der Routing-Falle zwischen Sonnet und Opus](https://www.alekseialeinikov.com/de/blog/topics/ai/claude-sonnet-5-5-vs-opus-5-5-vergleich).
- **Thinking ist an das Konto gebunden.** Die Thinking-Blöcke von Haiku 5.5 funktionieren nur in dem Konto, das sie erzeugt hat, oder in einem damit verknüpften. Ein gemeinsamer Konversationsspeicher, der Sessions über den Schlüssel eines anderen Kunden abspielt, verliert sie.
- **Der Verlauf muss append-only bleiben.** Bei Konten, die am oder nach dem 31. August 2026 angelegt wurden, liefert jede Änderung an `system`, `tools` oder früheren Nachrichten vor einem Haiku-5.5-Thinking-Block einen 400-Fehler.

![Opus 5.5 plant und verteilt abgegrenzte Teilaufgaben an Haiku-5.5-Subagents in frischen Konversationen; die Eskalation von Haiku zu Sonnet oder Opus behält das Thinking auf der Claude API und Google Cloud, das Zurückrouten zu Haiku verwirft das Thinking des größeren Modells](https://www.alekseialeinikov.com/blog/haiku-5-5-vs-sonnet-opus-routing.webp "Subagents starten frisch, also geht nichts verloren. Eskalation behält das Reasoning nur in eine Richtung.")

Das Subagent-Muster umgeht all das, weil jeder Subagent eine **frische Konversation** ist: Der Orchestrator schreibt ein Task-Briefing, der Subagent arbeitet es ab, das Ergebnis kommt als Text zurück. Nichts wird modellübergreifend erneut abgespielt, also geht nichts verloren. Was tatsächlich darüber entscheidet, ob es funktioniert:

- **Briefen Sie wie einen Junior-Engineer.** Eingaben, exaktes Ausgabeformat, Abnahmekriterien und was nicht angefasst werden darf. Bei FrontierCode – abgegrenzte, mergebare Änderungen – kommt Haiku 5.5 Sonnet am nächsten.
- **Halten Sie den Prompt jedes Subagents unter 100K.** Zwanzig Subagents über der Grenze kosten jeweils das Fünffache.
- **Prüfen Sie im Orchestrator, nicht im Subagent.** Lassen Sie den Planer Ergebnisse kontrollieren und neu vergeben, statt dass sich ein Subagent selbst abnimmt.

Wenn Sie ohnehin mit einem Coding-Agent arbeiten, ist das dieselbe Idee wie dessen eigene Subagents; wie Claude Code, Codex und opencode diese Arbeit strukturieren, steht in [KI-Coding-Agents: Claude Code vs. Codex vs. opencode](https://www.alekseialeinikov.com/de/blog/topics/ai/ki-coding-agents-2026-claude-code-vs-codex-vs-opencode).

## Migration von Haiku 4.5: Was bricht

Die Launch-Kommunikation nennt Haiku 5.5 für die meisten Integrationen einen Drop-in-Ersatz. Der [Migrationsleitfaden](https://platform.claude.com/docs/en/models/haiku-5-5/migration-guide) ist präziser – diese Dinge liefern Fehler:

| Was Sie heute an Haiku 4.5 senden | Bei Haiku 5.5 | Lösung |
|---|---|---|
| `claude-haiku-4-5` / `claude-haiku-4-5-20251001` | falsches Modell | `claude-haiku-5-5` (ohne Datumssuffix, kein separater Alias) |
| `thinking: {"type": "enabled", "budget_tokens": N}` | 400-Fehler | `{"type": "adaptive"}` plus `output_config.effort` |
| `temperature`, `top_p` oder `top_k` abweichend vom Standard | 400-Fehler | Weglassen; über den Prompt steuern |
| Ein abschließender Assistant-Turn als Prefill | 400-Fehler | Mit einem User-Turn enden; Format über Structured Outputs oder Tools |
| `computer_20250124` auf der Claude API oder Google Cloud | 400-Fehler | `computer_toolset_20260801` |
| Frühere Turns bearbeiten und Thinking zurücksenden | 400 bei Konten ab dem 31. August 2026 | Verlauf append-only halten |

Und Änderungen, die keine Anfrage scheitern lassen, aber Ergebnisse oder Rechnung verändern:

- **Antworten können mit Thinking-Blöcken beginnen.** Adaptives Thinking ist standardmäßig aktiv. Code, der `content[0].text` liest, bricht; wählen Sie Blöcke nach `type`.
- **Thinking zählt zu `max_tokens`.** Ein kleines Limit, das für Haiku 4.5 abgestimmt war, kann nach dem Thinking-Block ganz ohne Text enden.
- **Der Thinking-Text ist standardmäßig leer.** Haiku 4.5 lieferte zusammengefasstes Thinking; Haiku 5.5 liefert nur eine Signatur, außer Sie setzen `display: "summarized"`.
- **Derselbe Text ergibt rund 30 % mehr Tokens.** Prompts neu zählen, Budgets neu rechnen – und die 100K-Grenze erneut prüfen.
- **Kein Priority Tier.** Wer bei Haiku 4.5 eine Priority-Tier-Zusage hat, muss die Kapazität separat planen.

Eine minimale Klassifizierungsanfrage, die auf Haiku 5.5 so funktioniert:

```python
response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=1024,
    output_config={"effort": "low"},          # für nicht erzwungene Aufrufe; ein erzwungener Tool-Aufruf überspringt Thinking
    system=[{
        "type": "text",
        "text": CATEGORY_RULES,               # zusammen mit dem Ticket unter 100K halten
        "cache_control": {"type": "ephemeral"},  # Breakpoint auf dem statischen Teil, nicht dem Ticket
    }],
    tools=[classify_tool],                    # input_schema mit Enum der Kategorien
    tool_choice={"type": "tool", "name": "classify"},  # erzwungen: kein Thinking-Block
    messages=[{"role": "user", "content": ticket_text}],  # kein Assistant-Prefill
)

if response.stop_reason == "refusal":         # kein serverseitiger Fallback bei Haiku 5.5
    route_to_human(ticket_text)
else:
    label = next(b.input for b in response.content if b.type == "tool_use")
```

Ein Caching-Detail, das still Geld kostet: Nutzen Sie hier kein automatisches Caching auf oberster Ebene. Es setzt den Breakpoint auf den letzten Block – das Ticket, das sich bei jeder Anfrage ändert –, und der Cache trifft nie. Markieren Sie stattdessen den statischen System-Block und halten Sie `tools`, `tool_choice` und `effort` über alle Anfragen gleich, denn Änderungen daran invalidieren den Cache.

Am schnellsten durch eine echte Codebasis kommen Sie mit dem mitgelieferten Claude-API-Skill in Claude Code:

```text
/claude-api migrate this project to claude-haiku-5-5
```

## Refusals ohne Fallback

Haiku 5.5 bringt Schutzmechanismen für Cyber und Biologie mit. Anthropic beschreibt die Cyber-Schutzmechanismen als strenger als bei Haiku 4.5, aber lockerer als bei anderen aktuellen Modellen: Sie erlauben mehr defensive Aufgaben als bei Sonnet 5.5 und blockieren weiterhin Penetrationstests und andere Techniken, die eher von Angreifern genutzt werden. Die Biologie-Schutzmechanismen entsprechen Sonnet 5, Sonnet 5.5 und Opus 5.

Für Engineering-Teams zählt die Verdrahtung: Eine abgelehnte Anfrage liefert `stop_reason: "refusal"`, und **es gibt keinen serverseitigen Fallback** – die Arbeit läuft nicht auf einem anderen Modell weiter. Eine Pipeline, die eine Million Einträge verarbeitet, braucht dafür einen expliziten Zweig. Teams mit autorisierter offensiver Sicherheitsarbeit können sich für das [Cyber Verification Program](https://support.claude.com/en/articles/14604842) bewerben, um weniger Blockierungen zu bekommen.

## Welches Modell wofür?

- **Haiku 5.5 auf `low`** – Klassifizierung, Routing, Extraktion, Tagging, Moderations-Vorfilter, Compaction und erste Durchsicht von Dokumenten. Erzwingen Sie den Tool-Aufruf, wenn die Ausgabe ein Label ist. Nutzen Sie die Batch API, wann immer das Ergebnis nicht in Echtzeit gebraucht wird.
- **Haiku 5.5 auf `medium`** – Live-Kundensupport, In-App-Assistenten und Browser Use, wo Geschwindigkeit am meisten zählt und die Aufgabe klar definiert ist.
- **Haiku 5.5 als Subagent** – abgegrenzte Coding- und Recherche-Teilaufgaben unter einem Planer auf Opus 5.5 oder Sonnet 5.5, jeweils in einer frischen Konversation unter 100K Tokens.
- **Sonnet 5.5** – Ihr Standard für agentisches Coding und allgemeine Arbeit. Durch den halbierten Cache-Read-Preis ist es bei agentischer Arbeit jetzt rund 20 % günstiger; die Abwägung gegenüber Opus steht in [Sonnet 5.5 vs. Opus 5.5](https://www.alekseialeinikov.com/de/blog/topics/ai/claude-sonnet-5-5-vs-opus-5-5-vergleich).
- **Opus 5.5** – mehrdeutige Langzeitaufgaben und der Planer-Platz in einem Multi-Agent-System. Wer zusätzlich OpenAIs Mittelklasse-Modell abwägt, findet den Vergleich in [GPT-6.1 Sol vs. Claude Opus 5.5](https://www.alekseialeinikov.com/de/blog/topics/ai/gpt-6-1-sol-vs-claude-opus-5-5-vergleich).

## Fazit

Haiku 5.5 ist das erste kleine Claude-Modell, das Architekturentscheidungen verändert, nicht nur Rechnungen. Zu einem Zwanzigstel von Sonnets Preis bewältigt es Computer Use, Extraktion in der Wissensarbeit und abgegrenztes Coding gut genug, dass viel Traffic, der heute auf Sonnet läuft, nach unten wandern kann – und fast alles, was noch auf Haiku 4.5 läuft, sollte wechseln.

Aber es ist ein Spezialist, und es hat eine Preisregel, die kein anderes aktuelles Claude-Modell hat. Halten Sie Prompts unter 100.000 Tokens, erzwingen Sie Tool-Aufrufe für Labels, geben Sie Subagents frische Konversationen mit knappen Briefings, und lassen Sie Thinking nach oben zu Sonnet oder Opus fließen – zurück nach unten fließt es nie.
