Zum Inhalt springen

Gemini 4 Argon: starke Benchmarks, Zugang vorerst begrenzt

Google hat Gemini 4 Argon vorgestellt, freigegeben ist es aber nur für Cyberabwehr-Teams. Was die Benchmarks zeigen und wie weit der Leak danebenlag.

Andre Loreth7 Min. Lesezeit
Teilen
Gezeichnete Reihe massiver geometrischer Körper in Terrakotta und Oliv, daneben eine vollständig zusammengesetzte Pyramide hinter einer Absperrung aus Pfosten und Seil

Google hat am 30. September 2026 Gemini 4 Argon vorgestellt, doch nutzen darf das Modell vorerst fast niemand. Laut Google bekommen es zunächst nur ausgewählte Cyberabwehr-Teams im Fairwind-Programm sowie die US-Regierung im Rahmen eines freiwilligen Vorabzugangs. Laut Googles Tabelle führt Gemini 4 Argon zwölf von 18 Benchmarks an, die vorab kursierenden Werte lagen aber klar zu hoch.

Kurzfassung

  • Google hat Gemini 4 Argon am 30. September 2026 vorgestellt, zunächst aber nur für ausgewählte Cyberabwehr-Teams im Fairwind-Programm.
  • Laut Googles Tabelle führt das Modell zwölf von 18 Benchmarks an, bleibt auf Terminal-Bench 4.0 aber hinter Claude Opus 5.5 (Stand: 1. Oktober 2026).
  • Das betrifft Unternehmen, die Automatisierungen mit den leistungsstärksten KI-Modellen betreiben und wissen wollen, wann sich ein Wechsel lohnt.

Was Google angekündigt hat

Koray Kavukcuoglu, Chef von Google DeepMind, stellte das Modell im Google-Blog vor. Zugang haben zum Start nur vertrauenswürdige Cyberabwehr-Teams im Fairwind-Programm und die US-Regierung. Danach sollen zahlende API-Kunden und Abonnenten von Google AI Ultra folgen, „so schnell wie möglich“, ein Datum nennt Google nicht.

Viel Technik hat Google nicht veröffentlicht. Es gibt weder eine Modell-ID noch eine Model Card, und das Kontextfenster für die Eingabe fehlt in den Angaben. Laut Google liegt nur das Ausgabelimit fest: 1 Million Token, zuvor waren es 64.000. Der Name ist damit auch geklärt: Das Modell heißt Gemini 4 Argon, nicht Gemini 4 Pro.

Google nennt außerdem Einsätze im eigenen Haus. Das Modell soll bei Google 300 TiB Arbeitsspeicher freigeräumt, mehr als 800.000 Zeilen C und C++ nach Rust übertragen und die Bibliothek libgav1 um den Faktor 2,7 beschleunigt haben. Das sind Herstellerangaben, eine unabhängige Prüfung gibt es dazu nicht.

Benchmarks: Wo Argon führt und wo nicht

In Googles eigener Vergleichstabelle führt Argon zwölf von 18 Benchmarks an, ein Test endet unentschieden. Berichtet haben darüber unter anderem VentureBeat und heise. Es sind Messungen des Herstellers. Die Auswahl zeigt, wo das Modell vorn liegt und wo es zurückfällt:

BenchmarkGemini 4 ArgonClaude Opus 5.5GPT-6 Astra
DeepSWE v1.177,974,274,1
AutomationBench51,342,541,4
Harvey Legal Agent19,63,85,4
Terminal-Bench 4.057,466,4keine Angabe
FrontierSWE v255,0keine Angabe65,5
OSWorld 2.069,2keine Angabe72,6

Quelle: Google, laut Berichten von VentureBeat und MarkTechPost. „Keine Angabe“ heißt, dass die Tabelle für dieses Modell keinen Wert nennt.

Weitere Führungen nennt Google beim Finance Agent v2 (65,4), bei LVBench (91,7) und bei der Abwehr von Prompt Injection: Hier lag die Erfolgsquote der Angriffe laut dem Test von Gray Swan bei 0,7 Prozent. Bei CWE-bench liegt Argon mit 68 gleichauf mit GPT-6 Astra. Zurück liegt das Modell außerdem auf Terminal-Bench Science (57,6 gegenüber 68,1 bei GPT-6 Astra), und auf Terminal-Bench 4.0 steht Claude Sonnet 5.5 mit 70,6 noch vor Claude Opus 5.5.

Unabhängige Messungen stützen das Bild teilweise. Im Vals Index steht Argon mit 68,9 Prozent auf Platz eins von 41 Modellen. In der LMArena-Textrangliste führt es mit 1.525 Punkten (Unsicherheit plus/minus neun), auf Basis von 4.942 Stimmen und laut LMArena vorläufig (Stand: 1. Oktober 2026). Artificial Analysis sieht Argon mit 53 Punkten gleichauf mit GPT-6 Astra und nennt eine Halluzinationsrate von 15 Prozent.

Leak und Realität im Abgleich

Einen Tag vor der Vorstellung hatten wir im Faktencheck zu den Leaks geschrieben, dass die kursierende Tabelle zu „Gemini 4 Pro“ nicht zu den veröffentlichten Werten der Konkurrenz passt. Bei den Gemini-Werten war die Skepsis berechtigt, sie lagen klar zu hoch. Bei den Konkurrenzwerten lag der Faktencheck teilweise daneben: Die DeepSWE-Werte für Opus 5.5 und GPT-6 Astra sowie der OSWorld-Wert für Astra stehen genau so in Googles Tabelle.

Gruppiertes Balkendiagramm zu drei Benchmarks. DeepSWE v1.1: Leak-Wert für Gemini 4 Pro 88,7, offizieller Wert für Gemini 4 Argon 77,9, Claude Opus 5.5 laut Google 74,2. Terminal-Bench: Leak 95,3, offiziell 57,4, Claude Opus 5.5 66,4. OSWorld 2.0: Leak 86,8, offiziell 69,2, ohne Wert für Claude Opus 5.5.
Geleakte und offizielle Werte im Vergleich. Der Leak-Wert für Terminal-Bench stammt aus Version 2.1, der offizielle aus Version 4.0, die Balken sind daher nicht direkt vergleichbar.
LeakOffiziell
Name„Gemini 4 Pro“, Codename ArgonGemini 4 Argon
DeepSWE v1.188,777,9
Terminal-Bench95,3 (Version 2.1)57,4 (Version 4.0), hinter Opus 5.5
OSWorld 2.086,869,2
Kontext2, 1,5 oder 10 Millionen TokenEingabe nicht genannt, Ausgabe 1 Million Token
Preis je 1 Million Token2,25 und 11,25 US-Dollar2 und 10 US-Dollar, danach 4 und 20 US-Dollar
Konkurrenzwerte DeepSWE und OSWorld (74,2, 74,1, 72,6)im Leak enthaltenstimmen mit Googles Tabelle überein

Stand: 1. Oktober 2026. Leak-Werte aus dem Faktencheck vom 29. September 2026, offizielle Werte laut Google.

Bei DeepSWE und OSWorld lagen die geleakten Gemini-Werte um 10,8 beziehungsweise 17,6 Punkte über den offiziellen, während die Konkurrenzwerte daneben stimmten. Gerade diese richtigen Fremdwerte machten den Leak glaubwürdig. Andre Loreth zieht daraus eine praktische Lehre: Eine Tabelle, die bei den Konkurrenten stimmt, ist noch kein Beleg für die Werte des Modells, um das es geht.

Preis und Kosten pro Aufgabe

Der Einführungspreis liegt laut Google bei 2 US-Dollar für die Eingabe und 10 US-Dollar für die Ausgabe je 1 Million Token (Stand: Oktober 2026). Für zwischengespeicherte Eingaben gibt Google 95 Prozent Rabatt an, das sind 0,10 US-Dollar. Danach sollen 4 und 20 US-Dollar gelten, exakt der Listenpreis von Opus 5.5. GPT-6 Astra kostet 10 und 50 US-Dollar. Denselben Listenpreis hat OpenAI einen Tag zuvor mit GPT-6.1 Sol eingeführt, allerdings dauerhaft und schon nutzbar.

Andre Loreth hält für Automatisierungen den Preis pro Aufgabe für entscheidend, nicht den pro Token. Laut Artificial Analysis erzeugt Argon im Schnitt etwa 62.000 Ausgabe-Token pro Aufgabe, GPT-6 Astra etwa 27.000. Ein gerechnetes Beispiel, keine Messung: Zum Einführungspreis kostet die Ausgabe einer Argon-Aufgabe rund 0,62 US-Dollar, beim späteren Preis von 20 US-Dollar etwa 1,24 US-Dollar. Bei Astra sind es für 27.000 Token etwa 1,35 US-Dollar. Der Preisvorsprung schrumpft also stark, sobald der Einführungspreis ausläuft.

Auch der Vals Index weist Kosten aus: Laut Vals kostet ein Test mit Argon 15,68 US-Dollar, mit Opus 5.5 32,14 US-Dollar (Stand: 1. Oktober 2026). Wer KI-Agenten im Tagesgeschäft laufen lässt, sollte deshalb Token-Verbrauch und Fehlerquote am eigenen Ablauf messen und nicht nur die Preisliste vergleichen.

Offene Frage EU-Verarbeitung

Für Unternehmen in der EU kommt zum fehlenden Termin eine zweite Unbekannte hinzu. Zu Regionen hat Google bei Argon nichts mitgeteilt, und der EU-Endpunkt von Vertex AI führt bislang nur Flash-Modelle. Wer auf EU-Verarbeitung angewiesen ist, hat bei Google damit vorerst nur Gemini 3.8 Flash zur Wahl. Welche Zusagen sich unterscheiden und worauf Verträge achten sollten, steht im Beitrag KI und EU-Datenresidenz.

Checkliste für den Tag der Freigabe

Sobald Google das Modell für alle öffnet, lohnen diese Schritte:

  • Prüfe, ob die Modell-ID und eine Model Card auf ai.google.dev stehen, bevor du Zahlen aus Berichten übernimmst.
  • Schau nach, ob der EU-Endpunkt von Vertex AI das Modell führt oder nur der globale.
  • Kläre, wie lange der Einführungspreis gilt und welcher Preis danach greift.
  • Miss Token-Verbrauch und Antwortzeit an deinem eigenen Ablauf, denn lange Reasoning-Läufe bremsen Automatisierungen aus.
  • Vergleiche nur Benchmark-Werte derselben Version.

Einordnung

Andre Loreth hält Gemini 4 Argon für ein starkes Modell, das die meisten Unternehmen noch nicht nutzen können. Googles Gesamtbild hält er für plausibel, weil unabhängige Ranglisten wie der Vals Index und die LMArena in dieselbe Richtung zeigen. Dass Argon bei Terminal-Bench 4.0 und OSWorld 2.0 zurückliegt, relativiert das Bild: Ein klarer Gesamtsieger ist es nicht.

Wie zuverlässig ein Ablauf mit Argon läuft, sagen die Herstellerzahlen nicht. Eine Orientierung über Preise und Hosting-Pfade der aktuellen Modelle gibt der LLM-Vergleich für Unternehmen. Für Argon gilt: Erst wenn Google Termin, Preisdauer und EU-Verarbeitung nennt, lässt sich ein Wechsel planen.

Dieser Artikel ist mit Unterstützung künstlicher Intelligenz entstanden. Bei dem, was wir hier machen, wäre alles andere seltsam gewesen.

Teilen

NeuGoogle

Mach uns zu deiner bevorzugten Quelle

Google lässt dich festlegen, welche Seiten in deinen Suchergebnissen weiter oben stehen sollen. Markierst du uns als bevorzugte Quelle, tauchen unsere Artikel bei dir zuverlässiger auf.

Bei Google hinzufügen

Noch offene Fragen?

Gemini 4 Argon ist Googles am 30. September 2026 vorgestelltes Modell, nutzbar ist es vorerst nur für ausgewählte Cyberabwehr-Teams im Fairwind-Programm. Als Nächstes sollen laut Google zahlende API-Kunden und Abonnenten von Google AI Ultra folgen, ein Datum nennt Google nicht.

Laut Google beträgt der Listenpreis zunächst 2 US-Dollar für die Eingabe und 10 US-Dollar für die Ausgabe je 1 Million Token (Stand: Oktober 2026). Danach sollen es 4 und 20 US-Dollar sein, genauso viel wie bei Claude Opus 5.5.

Gemini 4 Pro ist der Name, unter dem das Modell in Leaks kursierte, Argon war dort der Codename. Google hat das Modell als Gemini 4 Argon vorgestellt, die geleakten Benchmark-Werte für Gemini lagen deutlich über den offiziellen.

EU-Datenresidenz heißt, dass der Anbieter vertraglich zusagt, Anfragen ausschließlich in EU-Rechenzentren zu verarbeiten. Zu Regionen hat Google bei Argon nichts mitgeteilt, und der EU-Endpunkt von Vertex AI führt bislang nur Flash-Modelle.

Gemini 4 Argon führt laut Googles eigener Tabelle zwölf von 18 Benchmarks an, liegt aber unter anderem bei Terminal-Bench 4.0 hinter Claude Opus 5.5. Unabhängig steht es auf dem ersten Platz des Vals Index (68,9 Prozent) und der LMArena-Textrangliste, dort allerdings vorläufig.

Du planst gerade eine KI-Automatisierung?

Wir gehen deinen Plan gemeinsam durch und sagen dir, wo wir anfangen würden.

Kostenloses Kennenlerngespräch

30 Minuten. Danach weißt du, welche drei Prozesse bei dir zuerst dran sind.

Lieber erst schreiben? E-Mail schreiben