Zurück zum Blog
Cloud
FortgeschrittenFürPlatform EngineersCloud ArchitectsAI Engineers
9 min

Gemini 4 Argon auf Google Cloud: Was sich für Platform-Teams wirklich ändert (2026)

Gemini 4 Argon ist seit dem 30. September 2026 angekündigt — aber nur für geprüfte Cyber-Verteidiger verfügbar. Was Platform-Teams auf Google Cloud jetzt ändern sollten: Budget für 1 Mio. Output-Tokens, Routing zwischen Argon und Gemini 3.8 Flash, Leitplanken für Agenten und die Fristen, die vor Argon kommen.

gemini-4-argonvertex-aigemini-enterprise-agent-platformgoogle-cloudllm-kostenkontrolleki-agenten-governance
Inhalt

Am 30. September 2026 hat Google Gemini 4 Argon angekündigt und nennt es sein bisher leistungsfähigstes Modell: State of the Art bei Software Engineering über lange Aufgaben, Platz eins im Vals Index und ein neues Output-Limit von 1 Million Tokens. Einen Tag später ging es in den Schlagzeilen schon um die unangenehmen Seiten: Mitarbeitende, die Bloomberg von Schwächen bei realen Coding-Aufgaben berichteten, und ein Evaluierungslabor, das das Modell beim Schummeln in einer Geschäftssimulation erwischt hat.

Für Platform-Teams auf Google Cloud sind beide Geschichten weniger wichtig als eine unscheinbare Tatsache: Fast niemand kann Argon heute produktiv aufrufen. Damit bleibt ein kurzes Zeitfenster, die Plattform vorzubereiten, damit der Wechsel glatt läuft, sobald der Zugang kommt. Hier steht, was tatsächlich erschienen ist, was es kostet und welche Änderungen sich jetzt lohnen.

Gemini 4 Argon auf Google Cloud: was sich für Platform-Teams ändert — 1 Mio. Output-Tokens, 2 $ / 10 $ pro Million Tokens, geschlossenes Preview

Was tatsächlich erschienen ist — und was nicht

Googles Ankündigung ist beim Zugang präzise, die Berichterstattung oft nicht. Argon wird über das Fairwind-Programm an ausgewählte Cyber-Verteidiger ausgerollt, im Rahmen des freiwilligen Pre-Release-Zugangs der US-Regierung. Google will Feedback sammeln, die Leitplanken härten und danach zuerst für zahlende API-Kunden und Abonnenten von Google AI Ultra freigeben, anschließend für Entwickler, Unternehmen und Endkunden. Ein Datum nennt Google nicht.

Öffentlich bekannt ist:

  • Preis: Einführungspreis von 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens, gecachter Input 95 % günstiger als der Input-Preis.
  • Output-Limit: 1 Mio. Tokens statt bisher 64K. Googles Begründung: Das Modell soll Spielraum haben, um „Hunderttausende Tokens in einer einzigen Trajektorie“ zu erzeugen.
  • Benchmarks (laut Google): 77,9 % auf DeepSWE v1.1 (Software Engineering über lange Aufgaben), Platz eins auf Zapiers AutomationBench mit 51,3 %, 91,7 % auf LVBench (lange Videos) und geteilter erster Platz auf CWE-bench v1 (Behebung von Schwachstellen) mit 68 %.
  • Interner Einsatz bei Google: Agenten, die anhand von Profiling-Daten der Flotte über 300 TiB Arbeitsspeicher in Googles Rechenzentren freigemacht haben, und Migrationen von C/C++ nach Rust mit bis zu 800K+ Zeilen.

Noch nicht öffentlich: Modell-ID, verfügbare Regionen, Quoten und Provisioned-Throughput-Optionen für die allgemeine Nutzung auf Google Cloud. Planen Sie so, als kämen diese Details mit wenig Vorlauf.

Rollout-Phasen von Gemini 4 Argon: zuerst Fairwind-Cyber-Verteidiger, dann zahlende API-Kunden und Google AI Ultra, danach Entwickler und Unternehmen — ohne angekündigte Termine
Argon kommt in Etappen. Plattformarbeit von heute zahlt sich am ersten Zugangstag aus.

Zuerst: die Vertex-AI-Umbenennung, die man leicht übersieht

Wer zuletzt tief in Infrastruktur steckte, hat womöglich eine strukturelle Änderung verpasst, die wichtiger ist als Argon selbst: Die Vertex-AI-Dienste sind jetzt Teil der Gemini Enterprise Agent Platform. Google hat das auf der Next ’26 im April angekündigt; die Vertex-AI-Dokumentation trägt inzwischen den Hinweis, dass sie nicht mehr aktualisiert wird, und verweist auf die Agent-Platform-Doku.

Bestehende Endpunkte funktionieren weiter, aber neue Modelle und Features — auch Argon — erscheinen auf der Agent-Platform-Seite. Zwei konkrete Fristen aus den Release Notes kommen vor Argon:

  • Gemini 2.5 Pro, 2.5 Flash und 2.5 Flash-Lite werden am 16. Oktober 2026 abgeschaltet.
  • Vertex AI Extensions werden nach dem 26. November 2026 eingestellt; Google empfiehlt die Migration auf die Agent Platform.

Wenn irgendwo noch eine fest verdrahtete gemini-2.5-*-Modell-ID steckt, ist das diesen Monat Ihre dringendste „Gemini“-Aufgabe — nicht Argon.

Argon vs. Gemini 3.8 Flash: was heute nutzbar ist

Das Modell, das Sie heute einsetzen können, ist Gemini 3.8 Flash, erschienen am 2. September 2026 und gebaut für Coding über lange Strecken und autonome Agenten. So stehen die beiden laut Googles veröffentlichten Angaben zueinander:

Argon vs. Gemini 3.8 Flash: was heute nutzbar ist
Gemini 3.8 Flash Gemini 4 Argon
Verfügbarkeit Gemini API, Gemini Enterprise, Agent Platform jetzt Fairwind; als Nächstes zahlende API + AI Ultra
Input-Preis / 1 Mio. Tokens 0,75 $ 2,00 $ (gecachter Input 95 % günstiger)
Output-Preis / 1 Mio. Tokens 3,75 $ 10,00 $
Max. Output pro Antwort nicht Teil der Ankündigung 1 Mio. Tokens (bisher 64K)
Positionierung „intelligentestes Arbeitspferd“ Frontier: tiefes Reasoning über lange Aufgaben
Cyber-Variante 3.8 Flash Cyber (nur Fairwind) Argon selbst, ohne Cyber-Leitplanken für geprüfte Verteidiger
Bester Einsatz Standard für Agenten und Coding die schwierigsten Aufgabenklassen, an denen Flash scheitert

Pro Token kostet Argon bei Input und Output etwa das 2,7-Fache von Flash. Google weist zudem darauf hin, dass 3.8 Flash „härter arbeitet“ — zusätzliche Reasoning-Schritte, wiederholte Tool-Aufrufe, bei hohem Effort also mehr Tokens. Der ehrliche Vergleich lautet deshalb Kosten pro gelöster Aufgabe, nicht Kosten pro Token: Braucht Flash drei Anläufe und Argon einen, kann das teure Modell das günstige sein.

Das 1-Mio.-Output-Limit ist ein Budgetproblem, kein Feature

Die folgenreichste Änderung für ein Platform-Team ist das Output-Limit. Zum Einführungspreis kostet eine einzige Antwort, die die volle Million Output-Tokens ausschöpft, 10 $ — für einen Aufruf. Mit dem alten 64K-Limit wäre derselbe Token-Preis bei etwa 0,64 $ gestoppt. Die Obergrenze pro Aufruf ist rund um das 16-Fache gestiegen, und jede Agenten-Schleife multipliziert sie.

Output-Kosten von Gemini 4 Argon pro Aufruf: 64K Tokens ≈ 0,64 $ gegenüber 1 Mio. Tokens = 10 $ bei 10 $ pro Million Output-Tokens, plus die Leitplanken, die das begrenzen
Ein höheres Output-Limit erhöht den Worst Case pro Aufruf. Pro Route deckeln, bevor Sie wechseln.

Bevor Argon in Ihrer Organisation ankommt, sollten diese Kontrollen stehen:

  1. Ein explizites Output-Limit pro Route. Verlassen Sie sich nie auf das Standard-Maximum des Modells. Ein Zusammenfassungs-Endpunkt braucht keine 1 Mio. Tokens, ein Migrations-Agent vielleicht mehr als 64K. Das Limit gehört pro Anwendungsfall in die Konfiguration.
  2. Labels an jedem Request. Gemini-API-Aufrufe auf Google Cloud akzeptieren Labels — damit lassen sich Kosten im Billing-Export nach Team, Route und Modell zuordnen. Ohne sie ist die erste Argon-Rechnung eine unerklärte Zeile.
  3. Budgets und Alerts pro Projekt. Experimenteller Argon-Traffic gehört in ein eigenes Projekt mit Budget-Alert, damit eine durchlaufende Schleife nach Stunden auffällt, nicht am Monatsende.
  4. Caching by Design. Mit 95 % Rabatt kostet gecachter Input 0,10 $ pro Million Tokens. Agenten, die bei jedem Schritt denselben Systemprompt, dieselben Tool-Schemas und denselben Repository-Kontext mitschicken, profitieren am stärksten. Prompts so aufbauen, dass der stabile Teil vorne steht.
  5. Timeouts und Streaming. Eine Antwort mit Hunderttausenden Tokens dauert Minuten, nicht Sekunden. Prüfen Sie Client-Timeouts, Idle-Timeouts am Load Balancer und Retry-Policies — ein blinder Retry einer 1-Mio.-Token-Antwort verdoppelt die Rechnung.

Modelle routen, nicht ersetzen

Den typischen Fehler erwarte ich als einzelne Konfigurationsänderung: model = "gemini-4-argon" für alles. Besser ist eine kleine Routing-Schicht vor den Modellen:

Modell-Routing auf Google Cloud: Ein Klassifizierer schickt einfache Anfragen an ein Decision Model, Standardarbeit an Gemini 3.8 Flash und nur schwere, lange Aufgaben an Gemini 4 Argon mit gedeckeltem Output-Budget
Der Großteil des Traffics sollte das Frontier-Modell nie berühren.
  • Klassifizierung und Routing übernimmt ein kleines, schnelles Modell — genau dafür ist die neue Klasse der Decision Models gebaut, die ich in Jev vs. GPT-5 und Claude für Klassifizierung verglichen habe.
  • Standardarbeit für Agenten und Coding geht an Gemini 3.8 Flash.
  • Schwere, lange Aufgaben — große Migrationen, Refactorings über mehrere Repositories, tiefe Incident-Analysen — gehen an Argon, mit gedeckeltem Budget und einem menschlichen Checkpoint.

Die Routing-Entscheidung ist zugleich Ihr Migrationshebel: Sobald Argon verfügbar ist, ändern Sie eine Regel für eine Aufgabenklasse und messen, statt den gesamten Traffic auf einmal umzustellen. Wer Agenten mit dem Agent Development Kit baut, hält das Modell als Konfiguration, nicht als Code — diese Struktur beschreibe ich in produktionsreife KI-Agenten mit Google ADK bauen.

Die Evaluierung nicht an einen Launch-Blogpost auslagern

Hersteller-Benchmarks zeigen, wo man hinschauen sollte, nicht, was man kaufen sollte. Argons erste Woche zeigt, warum:

  • Bloomberg berichtete, einige Google-Mitarbeitende hätten gesagt, das Modell habe in wichtigen realen Szenarien Probleme, unter anderem bei bestimmten Coding-Aufgaben. Google nannte die Behauptungen gegenüber Bloomberg unzutreffend.
  • Andon Labs meldete, Argon habe in seiner Geschäftssimulation Vending-Bench 2 Platz drei erreicht, hinter OpenAIs Astra und GPT-6 Sol — allerdings, indem es Bestätigungs-E-Mails erfand, Erstattungen verweigerte, Rechnungsfehler ausnutzte und Lieferanten anlog.

Keiner der Berichte entscheidet etwas, und genau darum geht es: Der einzige Benchmark, der für Ihre Entscheidung zählt, ist Ihr eigenes Aufgaben-Set. Bauen Sie jetzt eine kleine Eval-Suite — 50 bis 200 echte Aufgaben aus Ihrem Backlog mit einer Pass/Fail-Prüfung, der Sie vertrauen — und fahren Sie sie heute gegen Gemini 3.8 Flash. Kommt der Argon-Zugang, wiederholen Sie den Lauf und haben eine Entscheidung an einem Nachmittag statt in einem Quartal.

Argon-Agenten wie einen neuen privilegierten Nutzer behandeln

Google nennt vier Schutzmaßnahmen, die vor der breiten Freigabe verstärkt werden: Verweigerung von Missbrauch (Cyber und CBRN), Robustheit gegen indirekte Prompt Injection (laut Google führt Argon den Benchmark von Gray Swan an), Überwachung von Chain-of-Thought und Aktionen auf Fehlausrichtung mit Abbruch der Ausführung, wenn nötig, und gehärtete Sandboxes für risikoreiche Evaluierungen.

Das sind die Kontrollen des Modellanbieters. Ihre eigenen zählen mehr, und das Timing ist nicht abstrakt: In derselben Woche meldete OpenAI, mehr als 100 Organisationen über unautorisierte Aktivitäten seiner KI-Agenten informiert zu haben. Ein Agent, der stundenlang an einer langen Aufgabe arbeiten kann, kann auch stundenlang Schaden anrichten.

Auf Google Cloud sind die plattformseitigen Kontrollen vertraut:

  • Eine eigene Identität pro Agent mit Least-Privilege-IAM — nie ein geteilter Service Account, nie die Zugangsdaten eines Nutzers.
  • Tool-Allowlists, außerhalb des Modells durchgesetzt. Ein Agent erreicht nur die MCP-Tools, die seine Rolle braucht; das Gateway-Muster beschreibe ich in benutzerbezogene Zugriffskontrolle für MCP-Tools.
  • Ein Datenperimeter um die Projekte, die Agenten berühren (VPC Service Controls), damit ein verwirrter oder gekaperter Agent keine Daten hinausbringt.
  • Menschliche Freigabe für irreversible Aktionen — Deployments, Löschungen, Zahlungen, ausgehende E-Mails.
  • Alles auditieren: Requests, Tool-Aufrufe und Ergebnisse, damit sich rekonstruieren lässt, was ein Agent getan hat.

Die Fairwind-Frage für regulierte Branchen

Wer in einer Behörde, in kritischer Infrastruktur (Google nennt Gesundheitswesen, Telekommunikation, Energie und Finanznetze) oder bei einer zentralen Technologie-Plattform arbeitet, hat mit Fairwind den frühesten Weg zu Argon. Google spricht von mehr als 650 Partnern. Die Bedingungen sind streng und sinnvoll: Zugang nur für interne Security-, Incident-Response- oder Pentest-Teams, mit Schutzmaßnahmen wie Multi-Faktor-Authentifizierung.

Fairwind-Zugang ist eine Entscheidung des Security-Teams, keine Abkürzung für die Plattform. Wer Argon nur für allgemeine Engineering-Arbeit möchte, wartet auf den Rollout für zahlende API-Kunden. Bis dahin können laut Google alle Google-Cloud-Kunden den Schwachstellen-Agenten CodeMender bereits mit den öffentlich verfügbaren Modellen auf der Agent Platform nutzen.

Checkliste für dieses Quartal

Checkliste für dieses Quartal
Jetzt tun Warum
Jede gemini-2.5-*-Modell-ID ersetzen Abschaltung am 16.10.2026
Von Vertex AI Extensions migrieren Einstellung nach dem 26.11.2026
Modell-IDs und Output-Limits in die Konfiguration Wechsel pro Route in einer Zeile, sobald Argon kommt
Request-Labels + Budget-Alert pro Projekt Frontier-Kosten zuordnen und deckeln
Eval-Suite mit 50–200 Aufgaben bauen Auf eigenen Daten entscheiden, nicht auf Launch-Charts
Jedem Agenten eine eigene Least-Privilege-Identität Schadensradius lang laufender Agenten begrenzen
Klären, ob Fairwind für Sie infrage kommt Frühester legitimer Zugang für regulierte Teams

Fazit

Gemini 4 Argon ist ein echter Schritt nach vorn bei langen, schweren Aufgaben — und ein teurer, zugangsbeschränkter. Für die meisten Platform-Teams ist der richtige Schritt diese Woche nicht, Zugang zu jagen, sondern die Plattform vorzubereiten: Gemini 2.5 ablösen, Modellwahl und Output-Limits in die Konfiguration verlagern, jeden Request mit Labels und Budget versehen, eine vertrauenswürdige Eval-Suite bauen und Agenten Identitäten und Tool-Grenzen geben, die man auch einem neuen externen Dienstleister geben würde.

Dann wird der Tag, an dem Argon für Ihre Organisation freigeschaltet wird, eine Routing-Änderung und ein Eval-Lauf. Ohne diese Vorarbeit wird er eine überraschende Rechnung.

Häufig gestellte Fragen

Ist Gemini 4 Argon schon auf Vertex AI verfügbar?

Für die meisten Teams nicht. Google hat Gemini 4 Argon am 30. September 2026 angekündigt und rollt das Modell zuerst an ausgewählte Cyber-Verteidiger im Fairwind-Programm aus — im Rahmen des freiwilligen Pre-Release-Zugangs der US-Regierung. Als Nächstes sollen zahlende API-Kunden und Abonnenten von Google AI Ultra folgen, danach Entwickler und Unternehmen allgemein. Zum Zeitpunkt dieses Artikels gibt es kein öffentliches Datum, keine Modell-ID, keine Regionsliste und keine Quoten für die allgemeine Nutzung auf der Gemini Enterprise Agent Platform, in der die Vertex-AI-Dienste inzwischen aufgegangen sind.

Was kostet Gemini 4 Argon?

Google nennt einen Einführungspreis von 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens; gecachte Input-Tokens kosten 95 % weniger als der Input-Preis. Zum Vergleich: Gemini 3.8 Flash startete mit 0,75 $ pro Million Input- und 3,75 $ pro Million Output-Tokens — Argon kostet pro Token also etwa das 2,7-Fache. Da Argon jetzt bis zu 1 Million Output-Tokens in einer Antwort liefern kann, entscheidet das gesetzte Output-Limit stärker über die Kosten als der Preis pro Token.

Was ist das Fairwind-Programm?

Fairwind ist Googles Programm mit beschränktem Zugang, gestartet am 2. September 2026. Es gibt Regierungen, Betreibern kritischer Infrastruktur und zentralen Technologie-Plattformen frühen Zugang zu den stärksten Cyber-Abwehr-Modellen — zuerst Gemini 3.8 Flash Cyber, jetzt Gemini 4 Argon. Teilnehmer verpflichten sich, den Zugang auf interne Security-, Incident-Response- oder Pentest-Teams zu beschränken und Schutzmaßnahmen wie Multi-Faktor-Authentifizierung einzusetzen. Google spricht von mehr als 650 Partnern.

Sollte ich meine Produktions-Workloads von Gemini 3.8 Flash auf Argon umstellen?

Nicht pauschal. Gemini 3.8 Flash ist heute verfügbar, für Coding und Agenten über lange Strecken gebaut und deutlich günstiger. Argon lohnt sich bei schweren, mehrstufigen Aufgaben, an denen ein günstigeres Modell scheitert oder viele Anläufe braucht. Sinnvoll ist Routing: Flash bleibt Standard, nur die schwierigsten Aufgabenklassen gehen an Argon, sobald Sie Zugang haben — und der Gewinn wird vorher mit einem eigenen Eval-Set belegt.

Was ist aus Vertex AI geworden?

Seit Google Cloud Next im April 2026 werden die Vertex-AI-Dienste als Teil der Gemini Enterprise Agent Platform ausgeliefert; die Vertex-AI-Dokumentation wird nicht mehr aktualisiert. Bestehende Workloads laufen weiter, aber neue Modelle, Features und Doku erscheinen auf der Agent-Platform-Seite. Zwei Termine gehören in den Kalender: Gemini 2.5 Pro, Flash und Flash-Lite werden am 16. Oktober 2026 abgeschaltet, Vertex AI Extensions nach dem 26. November 2026.

Aus der Community

Diskussion im Fediverse

Antworten von Mastodon und Bluesky — direkt aus dem offenen Netz, ohne Tracking.

Antworten werden geladen …

ENDE