---
title: "Gemini 4 Argon auf Google Cloud: Was sich für Platform-Teams wirklich ändert (2026)"
description: "Gemini 4 Argon ist seit dem 30. September 2026 angekündigt — aber nur für geprüfte Cyber-Verteidiger verfügbar. Was Platform-Teams auf Google Cloud jetzt ändern sollten: Budget für 1 Mio. Output-Tokens, Routing zwischen Argon und Gemini 3.8 Flash, Leitplanken für Agenten und die Fristen, die vor Argon kommen."
author: Aleksei Aleinikov
date: 2026-10-02
lang: de
tags: [gemini-4-argon, vertex-ai, gemini-enterprise-agent-platform, google-cloud, llm-kostenkontrolle, ki-agenten-governance]
canonical: https://www.alekseialeinikov.com/de/blog/topics/cloud/gemini-4-argon-google-cloud-was-platform-teams-wissen-muessen
source: alekseialeinikov.com
---

# Gemini 4 Argon auf Google Cloud: Was sich für Platform-Teams wirklich ändert (2026)

Am 30. September 2026 hat Google **Gemini 4 Argon** angekündigt und nennt es sein bisher leistungsfähigstes Modell: State of the Art bei Software Engineering über lange Aufgaben, Platz eins im Vals Index und ein neues Output-Limit von 1 Million Tokens. Einen Tag später ging es in den Schlagzeilen schon um die unangenehmen Seiten: Mitarbeitende, die Bloomberg von Schwächen bei realen Coding-Aufgaben berichteten, und ein Evaluierungslabor, das das Modell beim Schummeln in einer Geschäftssimulation erwischt hat.

Für Platform-Teams auf Google Cloud sind beide Geschichten weniger wichtig als eine unscheinbare Tatsache: **Fast niemand kann Argon heute produktiv aufrufen.** Damit bleibt ein kurzes Zeitfenster, die Plattform vorzubereiten, damit der Wechsel glatt läuft, sobald der Zugang kommt. Hier steht, was tatsächlich erschienen ist, was es kostet und welche Änderungen sich jetzt lohnen.

![Gemini 4 Argon auf Google Cloud: was sich für Platform-Teams ändert — 1 Mio. Output-Tokens, 2 $ / 10 $ pro Million Tokens, geschlossenes Preview](https://www.alekseialeinikov.com/blog/gemini-4-argon.webp)

## Was tatsächlich erschienen ist — und was nicht

Googles Ankündigung ist beim Zugang präzise, die Berichterstattung oft nicht. Argon wird **über das Fairwind-Programm an ausgewählte Cyber-Verteidiger ausgerollt**, im Rahmen des freiwilligen Pre-Release-Zugangs der US-Regierung. Google will Feedback sammeln, die Leitplanken härten und danach zuerst für **zahlende API-Kunden und Abonnenten von Google AI Ultra** freigeben, anschließend für Entwickler, Unternehmen und Endkunden. Ein Datum nennt Google nicht.

Öffentlich bekannt ist:

- **Preis:** Einführungspreis von **2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens**, **gecachter Input 95 % günstiger** als der Input-Preis.
- **Output-Limit:** **1 Mio. Tokens** statt bisher **64K**. Googles Begründung: Das Modell soll Spielraum haben, um „Hunderttausende Tokens in einer einzigen Trajektorie“ zu erzeugen.
- **Benchmarks (laut Google):** 77,9 % auf DeepSWE v1.1 (Software Engineering über lange Aufgaben), Platz eins auf Zapiers AutomationBench mit 51,3 %, 91,7 % auf LVBench (lange Videos) und geteilter erster Platz auf CWE-bench v1 (Behebung von Schwachstellen) mit 68 %.
- **Interner Einsatz bei Google:** Agenten, die anhand von Profiling-Daten der Flotte über 300 TiB Arbeitsspeicher in Googles Rechenzentren freigemacht haben, und Migrationen von C/C++ nach Rust mit bis zu 800K+ Zeilen.

**Noch nicht** öffentlich: Modell-ID, verfügbare Regionen, Quoten und Provisioned-Throughput-Optionen für die allgemeine Nutzung auf Google Cloud. Planen Sie so, als kämen diese Details mit wenig Vorlauf.

![Rollout-Phasen von Gemini 4 Argon: zuerst Fairwind-Cyber-Verteidiger, dann zahlende API-Kunden und Google AI Ultra, danach Entwickler und Unternehmen — ohne angekündigte Termine](https://www.alekseialeinikov.com/blog/gemini-4-argon-rollout.webp "Argon kommt in Etappen. Plattformarbeit von heute zahlt sich am ersten Zugangstag aus.")

## Zuerst: die Vertex-AI-Umbenennung, die man leicht übersieht

Wer zuletzt tief in Infrastruktur steckte, hat womöglich eine strukturelle Änderung verpasst, die wichtiger ist als Argon selbst: **Die Vertex-AI-Dienste sind jetzt Teil der Gemini Enterprise Agent Platform.** Google hat das auf der Next '26 im April angekündigt; die Vertex-AI-Dokumentation trägt inzwischen den Hinweis, dass sie nicht mehr aktualisiert wird, und verweist auf die Agent-Platform-Doku.

Bestehende Endpunkte funktionieren weiter, aber neue Modelle und Features — auch Argon — erscheinen auf der Agent-Platform-Seite. Zwei konkrete Fristen aus den Release Notes kommen **vor** Argon:

- **Gemini 2.5 Pro, 2.5 Flash und 2.5 Flash-Lite werden am 16. Oktober 2026 abgeschaltet.**
- **Vertex AI Extensions werden nach dem 26. November 2026 eingestellt**; Google empfiehlt die Migration auf die Agent Platform.

Wenn irgendwo noch eine fest verdrahtete `gemini-2.5-*`-Modell-ID steckt, ist das diesen Monat Ihre dringendste „Gemini“-Aufgabe — nicht Argon.

## Argon vs. Gemini 3.8 Flash: was heute nutzbar ist

Das Modell, das Sie *heute* einsetzen können, ist **Gemini 3.8 Flash**, erschienen am 2. September 2026 und gebaut für Coding über lange Strecken und autonome Agenten. So stehen die beiden laut Googles veröffentlichten Angaben zueinander:

| | **Gemini 3.8 Flash** | **Gemini 4 Argon** |
|---|---|---|
| **Verfügbarkeit** | Gemini API, Gemini Enterprise, Agent Platform | jetzt Fairwind; als Nächstes zahlende API + AI Ultra |
| **Input-Preis / 1 Mio. Tokens** | 0,75 $ | 2,00 $ (gecachter Input 95 % günstiger) |
| **Output-Preis / 1 Mio. Tokens** | 3,75 $ | 10,00 $ |
| **Max. Output pro Antwort** | nicht Teil der Ankündigung | **1 Mio. Tokens** (bisher 64K) |
| **Positionierung** | „intelligentestes Arbeitspferd“ | Frontier: tiefes Reasoning über lange Aufgaben |
| **Cyber-Variante** | 3.8 Flash Cyber (nur Fairwind) | Argon selbst, ohne Cyber-Leitplanken für geprüfte Verteidiger |
| **Bester Einsatz** | Standard für Agenten und Coding | die schwierigsten Aufgabenklassen, an denen Flash scheitert |

Pro Token kostet Argon bei Input und Output etwa **das 2,7-Fache von Flash**. Google weist zudem darauf hin, dass 3.8 Flash „härter arbeitet“ — zusätzliche Reasoning-Schritte, wiederholte Tool-Aufrufe, bei hohem Effort also mehr Tokens. Der ehrliche Vergleich lautet deshalb **Kosten pro gelöster Aufgabe**, nicht Kosten pro Token: Braucht Flash drei Anläufe und Argon einen, kann das teure Modell das günstige sein.

## Das 1-Mio.-Output-Limit ist ein Budgetproblem, kein Feature

Die folgenreichste Änderung für ein Platform-Team ist das Output-Limit. Zum Einführungspreis kostet eine einzige Antwort, die die volle Million Output-Tokens ausschöpft, **10 $** — für einen Aufruf. Mit dem alten 64K-Limit wäre derselbe Token-Preis bei etwa **0,64 $** gestoppt. Die Obergrenze pro Aufruf ist rund um das 16-Fache gestiegen, und jede Agenten-Schleife multipliziert sie.

![Output-Kosten von Gemini 4 Argon pro Aufruf: 64K Tokens ≈ 0,64 $ gegenüber 1 Mio. Tokens = 10 $ bei 10 $ pro Million Output-Tokens, plus die Leitplanken, die das begrenzen](https://www.alekseialeinikov.com/blog/gemini-4-argon-output-budget.webp "Ein höheres Output-Limit erhöht den Worst Case pro Aufruf. Pro Route deckeln, bevor Sie wechseln.")

Bevor Argon in Ihrer Organisation ankommt, sollten diese Kontrollen stehen:

1. **Ein explizites Output-Limit pro Route.** Verlassen Sie sich nie auf das Standard-Maximum des Modells. Ein Zusammenfassungs-Endpunkt braucht keine 1 Mio. Tokens, ein Migrations-Agent vielleicht mehr als 64K. Das Limit gehört pro Anwendungsfall in die Konfiguration.
2. **Labels an jedem Request.** Gemini-API-Aufrufe auf Google Cloud akzeptieren Labels — damit lassen sich Kosten im Billing-Export nach Team, Route und Modell zuordnen. Ohne sie ist die erste Argon-Rechnung eine unerklärte Zeile.
3. **Budgets und Alerts pro Projekt.** Experimenteller Argon-Traffic gehört in ein eigenes Projekt mit Budget-Alert, damit eine durchlaufende Schleife nach Stunden auffällt, nicht am Monatsende.
4. **Caching by Design.** Mit 95 % Rabatt kostet gecachter Input 0,10 $ pro Million Tokens. Agenten, die bei jedem Schritt denselben Systemprompt, dieselben Tool-Schemas und denselben Repository-Kontext mitschicken, profitieren am stärksten. Prompts so aufbauen, dass der stabile Teil vorne steht.
5. **Timeouts und Streaming.** Eine Antwort mit Hunderttausenden Tokens dauert Minuten, nicht Sekunden. Prüfen Sie Client-Timeouts, Idle-Timeouts am Load Balancer und Retry-Policies — ein blinder Retry einer 1-Mio.-Token-Antwort verdoppelt die Rechnung.

## Modelle routen, nicht ersetzen

Den typischen Fehler erwarte ich als einzelne Konfigurationsänderung: `model = "gemini-4-argon"` für alles. Besser ist eine kleine Routing-Schicht vor den Modellen:

![Modell-Routing auf Google Cloud: Ein Klassifizierer schickt einfache Anfragen an ein Decision Model, Standardarbeit an Gemini 3.8 Flash und nur schwere, lange Aufgaben an Gemini 4 Argon mit gedeckeltem Output-Budget](https://www.alekseialeinikov.com/blog/gemini-4-argon-routing.webp "Der Großteil des Traffics sollte das Frontier-Modell nie berühren.")

- **Klassifizierung und Routing** übernimmt ein kleines, schnelles Modell — genau dafür ist die neue Klasse der Decision Models gebaut, die ich in [Jev vs. GPT-5 und Claude für Klassifizierung](https://www.alekseialeinikov.com/de/blog/topics/ai/jev-vs-gpt-5-claude-klassifizierung-routing) verglichen habe.
- **Standardarbeit für Agenten und Coding** geht an Gemini 3.8 Flash.
- **Schwere, lange Aufgaben** — große Migrationen, Refactorings über mehrere Repositories, tiefe Incident-Analysen — gehen an Argon, mit gedeckeltem Budget und einem menschlichen Checkpoint.

Die Routing-Entscheidung ist zugleich Ihr Migrationshebel: Sobald Argon verfügbar ist, ändern Sie eine Regel für eine Aufgabenklasse und messen, statt den gesamten Traffic auf einmal umzustellen. Wer Agenten mit dem Agent Development Kit baut, hält das Modell als Konfiguration, nicht als Code — diese Struktur beschreibe ich in [produktionsreife KI-Agenten mit Google ADK bauen](https://www.alekseialeinikov.com/de/blog/topics/cloud/google-adk-produktionsreife-ki-agenten-bauen-2026).

## Die Evaluierung nicht an einen Launch-Blogpost auslagern

Hersteller-Benchmarks zeigen, wo man hinschauen sollte, nicht, was man kaufen sollte. Argons erste Woche zeigt, warum:

- **Bloomberg** berichtete, einige Google-Mitarbeitende hätten gesagt, das Modell habe in wichtigen realen Szenarien Probleme, unter anderem bei bestimmten Coding-Aufgaben. Google nannte die Behauptungen gegenüber Bloomberg unzutreffend.
- **Andon Labs** meldete, Argon habe in seiner Geschäftssimulation Vending-Bench 2 Platz drei erreicht, hinter OpenAIs Astra und GPT-6 Sol — allerdings, indem es Bestätigungs-E-Mails erfand, Erstattungen verweigerte, Rechnungsfehler ausnutzte und Lieferanten anlog.

Keiner der Berichte entscheidet etwas, und genau darum geht es: Der einzige Benchmark, der für Ihre Entscheidung zählt, ist **Ihr eigenes Aufgaben-Set**. Bauen Sie jetzt eine kleine Eval-Suite — 50 bis 200 echte Aufgaben aus Ihrem Backlog mit einer Pass/Fail-Prüfung, der Sie vertrauen — und fahren Sie sie heute gegen Gemini 3.8 Flash. Kommt der Argon-Zugang, wiederholen Sie den Lauf und haben eine Entscheidung an einem Nachmittag statt in einem Quartal.

## Argon-Agenten wie einen neuen privilegierten Nutzer behandeln

Google nennt vier Schutzmaßnahmen, die vor der breiten Freigabe verstärkt werden: Verweigerung von Missbrauch (Cyber und CBRN), Robustheit gegen indirekte Prompt Injection (laut Google führt Argon den Benchmark von Gray Swan an), **Überwachung von Chain-of-Thought und Aktionen auf Fehlausrichtung mit Abbruch der Ausführung, wenn nötig**, und gehärtete Sandboxes für risikoreiche Evaluierungen.

Das sind die Kontrollen des Modellanbieters. Ihre eigenen zählen mehr, und das Timing ist nicht abstrakt: In derselben Woche meldete OpenAI, mehr als 100 Organisationen über unautorisierte Aktivitäten seiner KI-Agenten informiert zu haben. Ein Agent, der stundenlang an einer langen Aufgabe arbeiten kann, kann auch stundenlang Schaden anrichten.

Auf Google Cloud sind die plattformseitigen Kontrollen vertraut:

- **Eine eigene Identität pro Agent** mit Least-Privilege-IAM — nie ein geteilter Service Account, nie die Zugangsdaten eines Nutzers.
- **Tool-Allowlists, außerhalb des Modells durchgesetzt.** Ein Agent erreicht nur die MCP-Tools, die seine Rolle braucht; das Gateway-Muster beschreibe ich in [benutzerbezogene Zugriffskontrolle für MCP-Tools](https://www.alekseialeinikov.com/de/blog/topics/security/benutzerbezogene-zugriffskontrolle-mcp-tools-gateway-2026).
- **Ein Datenperimeter** um die Projekte, die Agenten berühren (VPC Service Controls), damit ein verwirrter oder gekaperter Agent keine Daten hinausbringt.
- **Menschliche Freigabe für irreversible Aktionen** — Deployments, Löschungen, Zahlungen, ausgehende E-Mails.
- **Alles auditieren**: Requests, Tool-Aufrufe und Ergebnisse, damit sich rekonstruieren lässt, was ein Agent getan hat.

## Die Fairwind-Frage für regulierte Branchen

Wer in einer Behörde, in kritischer Infrastruktur (Google nennt **Gesundheitswesen, Telekommunikation, Energie und Finanznetze**) oder bei einer zentralen Technologie-Plattform arbeitet, hat mit Fairwind den frühesten Weg zu Argon. Google spricht von mehr als 650 Partnern. Die Bedingungen sind streng und sinnvoll: Zugang nur für interne Security-, Incident-Response- oder Pentest-Teams, mit Schutzmaßnahmen wie Multi-Faktor-Authentifizierung.

Fairwind-Zugang ist eine Entscheidung des Security-Teams, keine Abkürzung für die Plattform. Wer Argon nur für allgemeine Engineering-Arbeit möchte, wartet auf den Rollout für zahlende API-Kunden. Bis dahin können laut Google alle Google-Cloud-Kunden den Schwachstellen-Agenten CodeMender bereits mit den öffentlich verfügbaren Modellen auf der Agent Platform nutzen.

## Checkliste für dieses Quartal

| Jetzt tun | Warum |
|---|---|
| Jede `gemini-2.5-*`-Modell-ID ersetzen | Abschaltung am **16.10.2026** |
| Von Vertex AI Extensions migrieren | Einstellung nach dem **26.11.2026** |
| Modell-IDs und Output-Limits in die Konfiguration | Wechsel pro Route in einer Zeile, sobald Argon kommt |
| Request-Labels + Budget-Alert pro Projekt | Frontier-Kosten zuordnen und deckeln |
| Eval-Suite mit 50–200 Aufgaben bauen | Auf eigenen Daten entscheiden, nicht auf Launch-Charts |
| Jedem Agenten eine eigene Least-Privilege-Identität | Schadensradius lang laufender Agenten begrenzen |
| Klären, ob Fairwind für Sie infrage kommt | Frühester legitimer Zugang für regulierte Teams |

## Fazit

Gemini 4 Argon ist ein echter Schritt nach vorn bei langen, schweren Aufgaben — und ein teurer, zugangsbeschränkter. Für die meisten Platform-Teams ist der richtige Schritt diese Woche nicht, Zugang zu jagen, sondern die Plattform vorzubereiten: Gemini 2.5 ablösen, Modellwahl und Output-Limits in die Konfiguration verlagern, jeden Request mit Labels und Budget versehen, eine vertrauenswürdige Eval-Suite bauen und Agenten Identitäten und Tool-Grenzen geben, die man auch einem neuen externen Dienstleister geben würde.

Dann wird der Tag, an dem Argon für Ihre Organisation freigeschaltet wird, eine Routing-Änderung und ein Eval-Lauf. Ohne diese Vorarbeit wird er eine überraschende Rechnung.
