Google hat am 30. September 2026 Gemini 4 Argon vorgestellt, doch nutzen darf das Modell vorerst fast niemand. Laut Google bekommen es zunächst nur ausgewählte Cyberabwehr-Teams im Fairwind-Programm sowie die US-Regierung im Rahmen eines freiwilligen Vorabzugangs. Laut Googles Tabelle führt Gemini 4 Argon zwölf von 18 Benchmarks an, die vorab kursierenden Werte lagen aber klar zu hoch.
Kurzfassung
- Google hat Gemini 4 Argon am 30. September 2026 vorgestellt, zunächst aber nur für ausgewählte Cyberabwehr-Teams im Fairwind-Programm.
- Laut Googles Tabelle führt das Modell zwölf von 18 Benchmarks an, bleibt auf Terminal-Bench 4.0 aber hinter Claude Opus 5.5 (Stand: 1. Oktober 2026).
- Das betrifft Unternehmen, die Automatisierungen mit den leistungsstärksten KI-Modellen betreiben und wissen wollen, wann sich ein Wechsel lohnt.
Was Google angekündigt hat
Koray Kavukcuoglu, Chef von Google DeepMind, stellte das Modell im Google-Blog vor. Zugang haben zum Start nur vertrauenswürdige Cyberabwehr-Teams im Fairwind-Programm und die US-Regierung. Danach sollen zahlende API-Kunden und Abonnenten von Google AI Ultra folgen, „so schnell wie möglich“, ein Datum nennt Google nicht.
Viel Technik hat Google nicht veröffentlicht. Es gibt weder eine Modell-ID noch eine Model Card, und das Kontextfenster für die Eingabe fehlt in den Angaben. Laut Google liegt nur das Ausgabelimit fest: 1 Million Token, zuvor waren es 64.000. Der Name ist damit auch geklärt: Das Modell heißt Gemini 4 Argon, nicht Gemini 4 Pro.
Google nennt außerdem Einsätze im eigenen Haus. Das Modell soll bei Google 300 TiB Arbeitsspeicher freigeräumt, mehr als 800.000 Zeilen C und C++ nach Rust übertragen und die Bibliothek libgav1 um den Faktor 2,7 beschleunigt haben. Das sind Herstellerangaben, eine unabhängige Prüfung gibt es dazu nicht.
Benchmarks: Wo Argon führt und wo nicht
In Googles eigener Vergleichstabelle führt Argon zwölf von 18 Benchmarks an, ein Test endet unentschieden. Berichtet haben darüber unter anderem VentureBeat und heise. Es sind Messungen des Herstellers. Die Auswahl zeigt, wo das Modell vorn liegt und wo es zurückfällt:
| Benchmark | Gemini 4 Argon | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|---|
| DeepSWE v1.1 | 77,9 | 74,2 | 74,1 |
| AutomationBench | 51,3 | 42,5 | 41,4 |
| Harvey Legal Agent | 19,6 | 3,8 | 5,4 |
| Terminal-Bench 4.0 | 57,4 | 66,4 | keine Angabe |
| FrontierSWE v2 | 55,0 | keine Angabe | 65,5 |
| OSWorld 2.0 | 69,2 | keine Angabe | 72,6 |
Quelle: Google, laut Berichten von VentureBeat und MarkTechPost. „Keine Angabe“ heißt, dass die Tabelle für dieses Modell keinen Wert nennt.
Weitere Führungen nennt Google beim Finance Agent v2 (65,4), bei LVBench (91,7) und bei der Abwehr von Prompt Injection: Hier lag die Erfolgsquote der Angriffe laut dem Test von Gray Swan bei 0,7 Prozent. Bei CWE-bench liegt Argon mit 68 gleichauf mit GPT-6 Astra. Zurück liegt das Modell außerdem auf Terminal-Bench Science (57,6 gegenüber 68,1 bei GPT-6 Astra), und auf Terminal-Bench 4.0 steht Claude Sonnet 5.5 mit 70,6 noch vor Claude Opus 5.5.
Unabhängige Messungen stützen das Bild teilweise. Im Vals Index steht Argon mit 68,9 Prozent auf Platz eins von 41 Modellen. In der LMArena-Textrangliste führt es mit 1.525 Punkten (Unsicherheit plus/minus neun), auf Basis von 4.942 Stimmen und laut LMArena vorläufig (Stand: 1. Oktober 2026). Artificial Analysis sieht Argon mit 53 Punkten gleichauf mit GPT-6 Astra und nennt eine Halluzinationsrate von 15 Prozent.
Leak und Realität im Abgleich
Einen Tag vor der Vorstellung hatten wir im Faktencheck zu den Leaks geschrieben, dass die kursierende Tabelle zu „Gemini 4 Pro“ nicht zu den veröffentlichten Werten der Konkurrenz passt. Bei den Gemini-Werten war die Skepsis berechtigt, sie lagen klar zu hoch. Bei den Konkurrenzwerten lag der Faktencheck teilweise daneben: Die DeepSWE-Werte für Opus 5.5 und GPT-6 Astra sowie der OSWorld-Wert für Astra stehen genau so in Googles Tabelle.
| Leak | Offiziell | |
|---|---|---|
| Name | „Gemini 4 Pro“, Codename Argon | Gemini 4 Argon |
| DeepSWE v1.1 | 88,7 | 77,9 |
| Terminal-Bench | 95,3 (Version 2.1) | 57,4 (Version 4.0), hinter Opus 5.5 |
| OSWorld 2.0 | 86,8 | 69,2 |
| Kontext | 2, 1,5 oder 10 Millionen Token | Eingabe nicht genannt, Ausgabe 1 Million Token |
| Preis je 1 Million Token | 2,25 und 11,25 US-Dollar | 2 und 10 US-Dollar, danach 4 und 20 US-Dollar |
| Konkurrenzwerte DeepSWE und OSWorld (74,2, 74,1, 72,6) | im Leak enthalten | stimmen mit Googles Tabelle überein |
Stand: 1. Oktober 2026. Leak-Werte aus dem Faktencheck vom 29. September 2026, offizielle Werte laut Google.
Bei DeepSWE und OSWorld lagen die geleakten Gemini-Werte um 10,8 beziehungsweise 17,6 Punkte über den offiziellen, während die Konkurrenzwerte daneben stimmten. Gerade diese richtigen Fremdwerte machten den Leak glaubwürdig. Andre Loreth zieht daraus eine praktische Lehre: Eine Tabelle, die bei den Konkurrenten stimmt, ist noch kein Beleg für die Werte des Modells, um das es geht.
Preis und Kosten pro Aufgabe
Der Einführungspreis liegt laut Google bei 2 US-Dollar für die Eingabe und 10 US-Dollar für die Ausgabe je 1 Million Token (Stand: Oktober 2026). Für zwischengespeicherte Eingaben gibt Google 95 Prozent Rabatt an, das sind 0,10 US-Dollar. Danach sollen 4 und 20 US-Dollar gelten, exakt der Listenpreis von Opus 5.5. GPT-6 Astra kostet 10 und 50 US-Dollar. Denselben Listenpreis hat OpenAI einen Tag zuvor mit GPT-6.1 Sol eingeführt, allerdings dauerhaft und schon nutzbar.
Andre Loreth hält für Automatisierungen den Preis pro Aufgabe für entscheidend, nicht den pro Token. Laut Artificial Analysis erzeugt Argon im Schnitt etwa 62.000 Ausgabe-Token pro Aufgabe, GPT-6 Astra etwa 27.000. Ein gerechnetes Beispiel, keine Messung: Zum Einführungspreis kostet die Ausgabe einer Argon-Aufgabe rund 0,62 US-Dollar, beim späteren Preis von 20 US-Dollar etwa 1,24 US-Dollar. Bei Astra sind es für 27.000 Token etwa 1,35 US-Dollar. Der Preisvorsprung schrumpft also stark, sobald der Einführungspreis ausläuft.
Auch der Vals Index weist Kosten aus: Laut Vals kostet ein Test mit Argon 15,68 US-Dollar, mit Opus 5.5 32,14 US-Dollar (Stand: 1. Oktober 2026). Wer KI-Agenten im Tagesgeschäft laufen lässt, sollte deshalb Token-Verbrauch und Fehlerquote am eigenen Ablauf messen und nicht nur die Preisliste vergleichen.
Offene Frage EU-Verarbeitung
Für Unternehmen in der EU kommt zum fehlenden Termin eine zweite Unbekannte hinzu. Zu Regionen hat Google bei Argon nichts mitgeteilt, und der EU-Endpunkt von Vertex AI führt bislang nur Flash-Modelle. Wer auf EU-Verarbeitung angewiesen ist, hat bei Google damit vorerst nur Gemini 3.8 Flash zur Wahl. Welche Zusagen sich unterscheiden und worauf Verträge achten sollten, steht im Beitrag KI und EU-Datenresidenz.
Checkliste für den Tag der Freigabe
Sobald Google das Modell für alle öffnet, lohnen diese Schritte:
- Prüfe, ob die Modell-ID und eine Model Card auf ai.google.dev stehen, bevor du Zahlen aus Berichten übernimmst.
- Schau nach, ob der EU-Endpunkt von Vertex AI das Modell führt oder nur der globale.
- Kläre, wie lange der Einführungspreis gilt und welcher Preis danach greift.
- Miss Token-Verbrauch und Antwortzeit an deinem eigenen Ablauf, denn lange Reasoning-Läufe bremsen Automatisierungen aus.
- Vergleiche nur Benchmark-Werte derselben Version.
Einordnung
Andre Loreth hält Gemini 4 Argon für ein starkes Modell, das die meisten Unternehmen noch nicht nutzen können. Googles Gesamtbild hält er für plausibel, weil unabhängige Ranglisten wie der Vals Index und die LMArena in dieselbe Richtung zeigen. Dass Argon bei Terminal-Bench 4.0 und OSWorld 2.0 zurückliegt, relativiert das Bild: Ein klarer Gesamtsieger ist es nicht.
Wie zuverlässig ein Ablauf mit Argon läuft, sagen die Herstellerzahlen nicht. Eine Orientierung über Preise und Hosting-Pfade der aktuellen Modelle gibt der LLM-Vergleich für Unternehmen. Für Argon gilt: Erst wenn Google Termin, Preisdauer und EU-Verarbeitung nennt, lässt sich ein Wechsel planen.