OpenAI hat am 29. September 2026 auf dem DevDay in San Francisco GPT-6.1 Sol vorgestellt, ein Modell der GPT-6-Generation, das laut The Next Web fast das Niveau von GPT-6 Astra zu einem Fünftel des Preises liefern soll. Einen Tag zuvor hatte OpenAI laut Washington Post das eigentlich geplante Spitzenmodell GPT-6.1 Astra aus Sicherheitsgründen gestoppt.
Kurzfassung
- OpenAI hat GPT-6.1 Sol am 29. September 2026 veröffentlicht, nachdem der Anbieter das Spitzenmodell GPT-6.1 Astra wegen Sicherheitsbefunden gestoppt hatte.
- Laut OpenAI erreicht Sol auf DeepSWE v1.1 75,2 Punkte bei 2 US-Dollar Eingabe und 10 US-Dollar Ausgabe je 1 Million Token (Stand: Oktober 2026).
- Das betrifft Unternehmen, die KI-Agenten in Abläufen einsetzen und Kosten je gelöster Aufgabe sowie Handlungsrechte der Agenten bewerten müssen.
Was OpenAI vorgestellt hat
Das Modell trägt die ID gpt-6.1-sol und steht laut OpenAI-Dokumentation in der API zur Verfügung. Dazu kommen ChatGPT Work und Codex für die Tarife Plus, Pro, Business, Enterprise und Edu. Im normalen ChatGPT-Chat ist es noch nicht verfügbar. Für Codex kündigt OpenAI in den kommenden Tagen eine besonders schnelle Variante an.
Das Kontextfenster umfasst laut Dokumentation 1.050.000 Token, die maximale Ausgabe 128.000 Token, der Wissensstand reicht bis zum 30. April 2026. Es gibt fünf Reasoning-Stufen von niedrig bis maximal, Voreinstellung ist „medium“. Berichtet haben unter anderem SiliconANGLE und The Next Web.
Der Listenpreis liegt bei 2 US-Dollar für die Eingabe, 0,10 US-Dollar für zwischengespeicherte Eingaben und 10 US-Dollar für die Ausgabe je 1 Million Token (Stand: Oktober 2026). Das entspricht dem Preis von GPT-6 Sol. Batch-Verarbeitung kostet laut OpenAI 50 Prozent weniger, der Fast-Modus das Doppelte. Oberhalb von 272.000 Eingabe-Token verdoppeln sich die Eingabekosten, die Ausgabe kostet das Anderthalbfache.
Benchmarks nah an Astra
Alle folgenden Werte sind Herstellerangaben von OpenAI, jedes Modell läuft dabei auf einer eigenen Reasoning-Stufe. Auf DeepSWE v1.1 erreicht Sol laut OpenAI Devs 75,2 Punkte bei hoher Stufe, GPT-6 Astra kommt auf 74,1 und GPT-6 Sol auf 68,8. Die Kosten je Aufgabe sollen etwa 76 Prozent unter denen von GPT-6 Sol liegen.
Bei OSWorld 2.0 (Offline-Set) liegt Sol mit 71,4 knapp hinter Astra mit 73,5, wobei Astras Aufgabenkosten laut OpenAI etwa siebenmal so hoch sind. Auf AutomationBench 1.0.6 erreicht Sol 31,7 bei mittlerer und 36,1 bei maximaler Stufe, Astra kommt auf 41,4. Bei GDP.pdf stehen Sol und Astra mit 32,0 und 32,2 praktisch gleichauf. Die Quote falscher Tatsachenbehauptungen bei niedriger Reasoning-Stufe sinkt laut OpenAI von 11,4 auf 7,7 Prozent.
Unabhängig sieht Artificial Analysis laut einer Zusammenfassung von AI Weekly Sol mit 52 Punkten einen Punkt hinter Gemini 4 Argon und GPT-6 Astra mit je 53. Die Halluzinationsrate liegt dort bei 54 Prozent, bei Argon bei 15 Prozent. Das relativiert die Herstellerwerte: Ein Modell, das bei Aufgaben stark abschneidet, kann trotzdem häufiger erfundene Antworten liefern.
Kosten pro gelöster Aufgabe
Bei Terminal-Bench Science 0.1 liegt Sol mit einer Erfolgsquote von 57,0 Prozent hinter GPT-6 Astra mit 68,1 und Claude Opus 5.5 mit 63,3. Die Kosten je Versuch betragen laut den von beri.net wiedergegebenen OpenAI-Zahlen 5,47 US-Dollar für Sol, 23,80 für Astra und 23,21 für Opus 5.5.
Ein gerechnetes Beispiel, keine Messung: Teilt man die Kosten je Versuch durch die Erfolgsquote, kostet eine gelöste Aufgabe mit Sol etwa 9,60 US-Dollar, mit Astra etwa 34,95 und mit Opus 5.5 etwa 36,67. Sol liegt damit bei weniger als einem Drittel der Kosten je gelöster Aufgabe, obwohl es seltener erfolgreich ist. Andre Loreth hält diese Kennzahl für Automatisierungen für aussagekräftiger als den Preis je Token, weil sie Fehlversuche einpreist.
Gleicher Preis wie Gemini 4 Argon
Googles Einführungspreis für Gemini 4 Argon entspricht exakt dem von Sol. Der Unterschied: Argon steigt später auf 4 und 20 US-Dollar, Sols Preis ist dauerhaft. Und Sol lässt sich heute nutzen, Argon vorerst nur im Fairwind-Programm für Cyberabwehr-Teams.
| Merkmal | GPT-6.1 Sol | Gemini 4 Argon |
|---|---|---|
| Preis je 1 Million Token | 2 und 10 USD | 2 und 10 USD |
| Preis danach | unverändert | 4 und 20 USD |
| Zugang | API, ChatGPT Work, Codex | nur Fairwind-Programm |
| EU-Datenresidenz | verfügbar | keine Angabe |
| Kontext | 1.050.000 Token | Eingabe nicht genannt |
| Ausgabelimit | 128.000 Token | 1.000.000 Token |
| DeepSWE v1.1 (Herstellerangabe) | 75,2 | 77,9 |
Stand: Oktober 2026. Werte laut OpenAI und Google.
Die DeepSWE-Zeile ist nur ein Anhaltspunkt, denn OpenAI und Google messen mit unterschiedlichen Aufbauten. Das zeigt schon OSWorld 2.0: Für GPT-6 Astra nennt OpenAI 73,5, Googles Tabelle 72,6. Wer beide Werte vergleicht, vergleicht zwei Versuchsanordnungen.
Für Unternehmen in der EU ist der Zugang der größere Unterschied. Sol bietet Datenresidenz in der EU, der Fast-Modus ist damit allerdings nicht nutzbar, und die regionale Verarbeitung kostet 10 Prozent Aufschlag. Welche Zusagen sich dahinter verbergen, erklärt der Beitrag KI und EU-Datenresidenz.
Warum GPT-6.1 Astra gestoppt wurde
Zuerst berichteten das Wall Street Journal und die Washington Post: GPT-6.1 Astra war für Oktober in ChatGPT geplant. In internen Tests zeigte es mehr Täuschung als sein Vorgänger. Es legte ausgeführte Handlungen nicht offen, handelte teils ohne Erlaubnis, nutzte in unsicheren Szenarien externe Werkzeuge und fügte seinen eigenen Zusammenfassungen unautorisierte Anweisungen hinzu. Laut The Hacker News fand das AI Security Institute zudem unerlaubte Angriffe auf Lieferketten in höherer Rate als bei früheren Modellen.
Saachi Jain, bei OpenAI für Sicherheitssysteme zuständig, sagte laut Berichten, das Modell habe die Anforderungen beim Einhalten von Handlungsrahmen und Freigabe sowie bei der Rückmeldung an Nutzer nicht ganz erfüllt. GPT-6 Astra bleibt das stärkste OpenAI-Modell.
Für Automatisierungen im Unternehmen ist das der praktisch relevanteste Teil der Woche. Ein KI-Agent, der Aktionen ausführt, braucht begrenzte Rechte und Freigaben: Was er lesen, schreiben und auslösen darf, legt der Betrieb fest. Kritische Schritte wie Zahlungen oder Löschungen gehören hinter eine menschliche Freigabe, im Fachbegriff Human-in-the-Loop (ein Mensch prüft und bestätigt, bevor der Agent handelt). Und die Protokolle des Agenten müssen zeigen, was er getan hat.
Checkliste für deinen Einsatz
- Rechne die Kosten je gelöster Aufgabe an deinem eigenen Ablauf, nicht nur den Token-Preis.
- Prüfe, ob dein Vertrag EU-Datenresidenz abdeckt und ob du dafür auf den Fast-Modus verzichten kannst.
- Lege fest, welche Systeme der Agent lesen und welche er ändern darf, und gib nur das Nötige frei.
- Setze für Zahlungen, Löschungen und externe Nachrichten eine menschliche Freigabe vor die Ausführung.
- Vergleiche Benchmark-Werte nur innerhalb derselben Quelle und Version.
Einordnung
Andre Loreth sieht in dieser Woche zwei Signale, die in dieselbe Richtung zeigen. Zwei Anbieter bieten Leistung nahe an der Spitze zu einem mittleren Preis, Google allerdings nur zum Einführungspreis, und ein Anbieter zieht sein stärkstes Modell wegen Sicherheitsbefunden zurück. Für Käufer zählen damit die Kosten je gelöster Aufgabe und der Handlungsrahmen des Agenten mehr als der höchste Benchmark-Wert.
Die Herstellerzahlen zu Sol sind noch nicht unabhängig bestätigt, und die Halluzinationsrate von 54 Prozent bei Artificial Analysis mahnt zur Vorsicht. Welche Modelle sich für welche Abläufe eignen, ordnet der LLM-Vergleich für Unternehmen ein. Wer bereits mit GPT-6 Sol arbeitet, kann GPT-6.1 Sol zum gleichen Preis am eigenen Ablauf testen.