2026 fragen sich viele Unternehmen nicht mehr, ob sie KI einsetzen, sondern welches LLM für welchen Workflow passt. GPT-6, Claude Sonnet 5, Gemini 3.8, Mistral und Open-Weight-Modelle erscheinen schneller, als sich die Unterschiede einordnen lassen.
Dieser LLM Vergleich ist keine Benchmark-Tabelle aus dem Labor. Er ist ein Entscheidungsrahmen: welche Kriterien für den B2B-Einsatz in Deutschland zählen, über welchen Pfad ein Modell tatsächlich in der EU läuft, und was das kostet.
Kurzfassung
Kein Modell ist für alle Workflows das beste, und “EU-Hosting” heißt bei keinem Anbieter automatisch DSGVO-konform. Anthropic bietet über die eigene API gar keine EU-Inferenz an, OpenAI und Mistral nur über einen separaten, meist teureren Endpunkt. Für Workflows ohne fremde Server bleibt der Eigenbetrieb von Open-Weight-Modellen die einzige belastbare Antwort.
Die Kriterien, die die Modellwahl leiten
Benchmarks messen Modellleistung unter Laborbedingungen. Im Unternehmenseinsatz entscheiden andere Faktoren:
Datenklasse und Hosting-Anforderung. Welche Daten kommen in den Workflow? Personenbezogene Daten, Vertragsinhalte oder Informationen mit berufsrechtlichen Anforderungen brauchen einen dokumentierten EU-Hosting-Pfad mit Auftragsverarbeitungsvertrag (AVV), für Standard-Bürodaten reicht ein normaler Business-Tarif.
Trainingsrichtlinie. Trainiert der Anbieter auf deinen Prompts? Bei OpenAI und Anthropic ist das über API und Business-Tarife ausgeschlossen. Bei Google trainiert nur die kostenlose Gemini-API-Stufe auf Nutzerdaten, die bezahlte nicht. Bei Mistral trainiert die Standardversion von Vibe (dem früheren Le Chat) standardmäßig, die Enterprise-Variante ist ausgenommen.
Aufgabenprofil und Modellstärken. Lange Dokumente, strukturiertes Reasoning (mehrstufiges Schlussfolgern), Codegenerierung, Bildanalyse, Multilingualität: Hier liegen die größten Unterschiede zwischen Modellen, sie entscheiden, ob eines für einen Workflow wirklich funktioniert oder nur ausreicht.
Kosten, Integration und Kontrolle. Neben API-Preisen und EU-Aufschlägen zählt, wie das Modell an bestehende Systeme angebunden wird und wie viel Kontrolle der Workflow braucht. Reicht eine SaaS-Oberfläche, oder braucht es eigene Modellauswahl und Infrastruktur? Das entscheidet, ob ein Cloud-Modell oder eine private KI die richtige Architektur ist.
Die Modelle im Überblick
Stand: September 2026. Preise sind Listenpreise der Anbieter in US-Dollar je 1 Million Token, ohne Rabatte oder Batch-Tarife, laut den Preisseiten von OpenAI, Anthropic, Google und Mistral. Wer die Modelle nicht direkt über die API anbinden will, bekommt mehrere davon gebündelt auch über Sitzlizenz-Plattformen wie Langdock, siehe den Beitrag Langdock Alternative: eigene KI-Plattform.
| Modell | Anbieter-Sitz | EU-Inferenz | Preis Input/Output (USD/1M) | Kontext | Open-Weight |
|---|---|---|---|---|---|
| GPT-6 Astra | USA | Nur mit Freigabe (EU-Projekt, Zero Data Retention) | 10 / 50 | 1,05 Mio. | Nein |
| GPT-6 Sol | USA | Nur mit Freigabe (EU-Projekt, nur Standard-Verarbeitung) | 2 / 10 | 1,05 Mio. | Nein |
| GPT-6 Luna | USA | Nur mit Freigabe (EU-Projekt, nur Standard-Verarbeitung) | 0,10 / 0,50 | 1,05 Mio. | Nein |
| Claude Opus 5.5 | USA | Nur via AWS Bedrock oder Google Vertex | 4 / 20 | 1 Mio. | Nein |
| Claude Sonnet 5.5 | USA | Nur via AWS Bedrock oder Google Vertex | 2 / 10 | 1 Mio. | Nein |
| Claude Haiku 4.5 | USA | Nur via AWS Bedrock oder Google Vertex | 1 / 5 | 200.000 | Nein |
| Gemini 3.8 Flash | USA | Vertex-EU-Multiregion | 0,75 / 3,75 (ab Januar 2027: 1,50 / 7,50) | 1 Mio. (Output 65.536) | Nein |
| Gemini 3.1 Pro (Preview) | USA | Keine EU-Garantie | 2 bis 4 / 12 bis 18, gestaffelt nach Kontextlänge | 1 Mio. | Nein |
| Mistral Medium 3.5 | Frankreich | api.eu.mistral.ai | 1,50 / 7,50 | 256.000 | Ja, Modified MIT |
| Mistral Large 3 | Frankreich | api.eu.mistral.ai | 0,50 / 1,50 | 256.000 | Ja, Apache 2.0 |
Open-Weight-Modelle, also Modelle mit offenen Gewichten, für den Eigenbetrieb (Self-Hosting) ohne API-Preis:
| Modell | Lizenz | Herkunft |
|---|---|---|
| Muse Glimmer 30B | Apache 2.0 | Meta (USA) |
| Gemma 4 | Apache 2.0 | Google (USA) |
| gpt-oss-120b | Apache 2.0 | OpenAI (USA) |
| Qwen 3.6 / 3.8 | Apache 2.0 (größtes Modell unter eigener Qwen-Lizenz) | Alibaba (China) |
| DeepSeek V4 | MIT | DeepSeek (China) |
Prüfe die aktuellen Preislisten und den AVV vor Vertragsschluss, beides ändert sich häufiger als diese Tabelle.
Die LMArena-Rangliste für Deutsch (CC BY 4.0, Stand September 2026, 299 Modelle) zeigt: Die obersten rund 20 Modelle liegen innerhalb ihrer statistischen Unsicherheit praktisch gleichauf. Ein Rangunterschied von wenigen Plätzen an der Spitze ist deshalb kein verlässliches Auswahlkriterium.
OpenAI: breitester Einstieg, EU nur mit Freigabe
OpenAI ist mit der dreistufigen GPT-6-Familie (Astra, Sol, Luna) das verbreitetste Angebot, auch dank ChatGPT Enterprise und der engen Verzahnung mit Microsoft. GPT-6 Astra ist das stärkste, teuerste Modell, GPT-6 Sol ein guter Allrounder für Standard-Workflows, GPT-6 Luna die günstige Variante für einfache Aufgaben. Seit dem 22. September 2026 kosten Sol und Luna laut OpenAI rund die Hälfte der Vorgängerpreise, mehr dazu im Beitrag GPT-6 Sol und Luna.
EU-Inferenz, also die Verarbeitung deiner Anfragen in europäischen Rechenzentren, gibt es mit Garantie über zwei Wege: über die OpenAI-API selbst mit EU-Projekt, Vertriebsfreigabe und Zero Data Retention, oder über Azure Foundry mit Data Zone Standard EU in neun EU-Regionen inklusive Germany West Central. Die Azure EU Data Zone deckt allerdings nur GPT-5.x ab, GPT-6 Astra ist dort laut Microsoft-Dokumentation (Stand September 2026) noch nicht gelistet. Wer auf das neueste Modell mit EU-Garantie angewiesen ist, muss also den API-Weg mit Freigabe gehen, wobei Sol und Luna dort aktuell nur mit Standard-Verarbeitung EU-Datenresidenz unterstützen.
OpenAI ist die richtige Wahl, wenn der Workflow allgemein und flexibel gehalten ist, das Unternehmen im Microsoft-Ökosystem verwurzelt ist, oder Tool-Calling und Agenten-Architekturen zählen. Den Vergleich zwischen Copilot-Pfad und anderen Cloud-Alternativen beleuchtet der Beitrag Microsoft Copilot Alternative für Unternehmen.
Anthropic: stark bei langen Dokumenten, EU nur über AWS oder Google
Claude Fable 5.1, Opus 5.5, Sonnet 5.5 und Haiku 4.5 eignen sich vor allem für Workflows mit langen Dokumenten, Vertragsanalyse, mehrstufigem Reasoning oder strukturierter Extraktion aus unstrukturiertem Text. Claude hat mit bis zu 1 Million Token ein großes Kontextfenster und ist auf präzise, anspruchsvolle Aufgaben ausgelegt, bei denen Nuancen zählen. Anthropic hat Opus 5.5 am 22. September 2026 und Sonnet 5.5 am 28. September 2026 veröffentlicht, zu Preisen und Benchmarks mehr in den Beiträgen Claude Opus 5.5 und Claude Sonnet 5.5.
Bei der EU-Compliance liegt der wichtigste Unterschied zu OpenAI: Die Anthropic-API selbst unterstützt laut eigener Data-Residency-Dokumentation nur die Regionen “us” und “global”, keine EU-Option. Eine garantierte EU-Inferenz gibt es ausschließlich über AWS Bedrock oder Google Vertex, jeweils mit regionalem Endpunkt.
Claude eignet sich für Unternehmen, die Dokumente analysieren wollen, ohne ihre Daten uneingeschränkt US-Servern zu überlassen, solange der Zugang über Bedrock oder Vertex mit EU-Endpunkt läuft. Wie ein vollständiges datenschutzkonformes KI-Setup dabei aussieht, erklärt der Beitrag Datenschutzkonforme KI für Unternehmen.
Google: Multimodalität über Vertex, mit Lücken bei neuen Modellen
Gemini 3.8 Flash ist Googles aktuelles Arbeitspferd für schnelle, multimodale Aufgaben: Es verarbeitet Text, Bilder und Code nativ, mit einem Kontextfenster von 1 Million Token. Gemini 3.1 Pro (Preview) ist das leistungsstärkere, aber noch nicht final freigegebene Modell für anspruchsvollere Aufgaben. Gemini 4 ist noch nicht erschienen, den bestätigten Stand und die Leaks dazu ordnet der Beitrag Gemini 4 ein.
EU-Datenresidenz ist über Google Cloud Vertex AI als EU-Multiregion verfügbar, allerdings nur für die aktuellen Flash-Modelle der 3.x-Reihe. Gemini 3.1 Pro (Preview) ist in der Vertex-Datenresidenz-Dokumentation aktuell nicht gelistet, wer darauf angewiesen ist, sollte das vor dem Rollout mit Google klären.
Gemini ist die stärkste Wahl, wenn der Workflow Bilder, Grafiken oder Dokumente mit visuellen Elementen verarbeiten soll, oder wenn eine enge Anbindung an Google Workspace effizient ist.
Mistral: EU-nativer Endpunkt, mit Einschränkungen im Kleingedruckten
Mistral mit Sitz in Paris ist der einzige europäische Anbieter in dieser Übersicht, der Spitzenmodelle über eine eigene API anbietet. Mistral Medium 3.5 und Mistral Large 3 sind beide Open-Weight-Modelle (Modified MIT beziehungsweise Apache 2.0) und günstiger als die meisten US-Flaggschiffe.
EU-Verarbeitung garantiert nur der EU-Endpunkt api.eu.mistral.ai, der globale Endpunkt api.mistral.ai macht keine Standortzusage. Außerdem laufen Agents, Batch-Verarbeitung und die Files-API laut Mistral-Dokumentation nicht über den regionalen Endpunkt. Ihre Kontrollebene-Daten können die EU verlassen, auch wenn die Modell-Inferenz selbst regional gebunden bleibt.
Wer keine US-Anbieter einbinden will, aber solide Modellleistung braucht, ist mit Mistral gut bedient, solange Agents und Batch-Funktionen nicht Teil des Workflows sind.
Aleph Alpha und Cohere: Fusion angekündigt, noch nicht vollzogen
Aleph Alpha aus Heidelberg bleibt eine Plattform für Organisationen mit hohen Sicherheitsanforderungen, mit On-Premise- und privaten europäischen Hosting-Optionen. Im April 2026 wurde eine Fusion mit der kanadischen Cohere angekündigt, bei der Cohere-Aktionäre rund 90 Prozent am kombinierten Unternehmen halten würden. Der Abschluss steht laut Berichterstattung noch unter dem Vorbehalt kanadischer, deutscher und europäischer Zulassungsbehörden. Was die angekündigte Fusion für die Einordnung als souveräne KI bedeutet, ordnet der Beitrag Mistral-Finanzierung und europäische KI-Souveränität ein.
Meta und Open-Weight-Modelle: volle Datenkontrolle, höherer Betriebsaufwand
Metas Muse Spark ist ein geschlossenes Modell, für den Eigenbetrieb relevant ist stattdessen Muse Glimmer 30B, seit August 2026 unter Apache 2.0 mit 131.000 Token Kontext frei verfügbar. Damit bleiben Modell, Inferenz und Daten vollständig unter eigener Kontrolle, ohne externe API oder Datenweitergabe an Dritte.
Für den EU-Einsatz relevant: Llama 4 unterliegt für in der EU ansässige Unternehmen weiterhin einer Nutzungsbeschränkung für multimodale Funktionen, festgelegt in Metas Acceptable Use Policy. Muse Glimmer hat diese Klausel nicht. Für multimodale Aufgaben im Eigenbetrieb sind deshalb Muse Glimmer, Mistral-Modelle unter Apache 2.0 oder Gemma 4 die unkompliziertere Wahl.
Der Nachteil des Eigenbetriebs ist der Aufwand: GPU-Infrastruktur, Rollout, Updates und Monitoring brauchen interne Kompetenz oder externe Begleitung. Wie eine private KI-Infrastruktur mit Open-Weight-Modellen sinnvoll aufgesetzt wird, erklärt der Beitrag Private KI-Infrastruktur für Unternehmen. Nicht jedes Open-Weight-Modell muss dabei riesig sein: Cactus Needle ist ein Modell mit 121 Millionen Parametern, das nur einen eng abgegrenzten Schritt übernimmt: Tool-Calling direkt auf dem Gerät.
Was EU-Hosting kostet und wo es endet
“EU-Hosting” ist kein fester Zustand. Die Reichweite hängt vom Anbieter und vom Zugangsweg ab. Die folgende Matrix zeigt, wo Inferenz garantiert in der EU läuft, wo es nur mit Auflagen geht und wo es gar nicht verfügbar ist.
Zwei Punkte gehören in jede Vertragsprüfung. Erstens der Aufschlag: EU-Endpunkte kosten bei OpenAI, AWS Bedrock, Google Vertex und Mistral rund 10 Prozent mehr als der globale Endpunkt. Zweitens die Grenzfälle: AWS Bedrock zählt Zürich und London zu seinen “EU”-Regionen, beide liegen außerhalb der EU. Für Compliance-Anforderungen zählt die konkrete Region im Vertrag, nicht nur das Label “EU”. Wie sich Verarbeitungsort, Speicherung, Missbrauchserkennung und Vertragspartner sauber auseinanderhalten lassen, beschreibt der Beitrag KI und EU-Datenresidenz.
Was deutsche Unternehmen tatsächlich nutzen
Zwischen dem Wunsch nach KI aus Deutschland und der tatsächlichen Nutzung liegt eine deutliche Lücke. In der Bitkom-Befragung von 604 Unternehmen ab 20 Beschäftigten (Studienbericht KI, veröffentlicht Februar 2026) sagen 93 Prozent, dass sie deutsche KI-Anbieter bevorzugen. Eingesetzt werden aber fast nur US-Dienste: Von den Unternehmen, die generative KI nutzen, setzen 70 Prozent ChatGPT ein, 28 Prozent Microsoft Copilot und 22 Prozent Gemini. Aleph Alpha kommt auf 0,3 Prozent, Mistral auf 0,2 Prozent.
Als größte Hürde für den KI-Einsatz nennen Unternehmen den Datenschutz, 77 Prozent in einer weiteren Bitkom-Befragung vom März 2026.
Was ein LLM heute kostet, und warum die Spitze davon nicht profitiert
Die Kosten für KI-Qualität sind in den vergangenen Jahren stark gefallen, allerdings nur unterhalb der Spitze. Nach einer Auswertung von Epoch AI (März 2025) fiel der Preis, um GPT-4-Niveau auf dem GPQA-Benchmark zu erreichen, um rund das 40-fache pro Jahr. Die Flaggschiffe sind davon ausgenommen: GPT-4 kostete 2023 zum Start 60 US-Dollar Output je 1 Million Token, GPT-4.5 preview im Februar 2025 sogar 150 US-Dollar, GPT-6 Astra und Claude Fable 5.1 liegen heute bei 50 US-Dollar. Das günstigste Modell, das in der deutschen LMArena-Wertung mindestens GPT-4-Niveau erreicht, kostet dagegen 0,40 US-Dollar (GPT-4.1 nano).
Für die Budgetplanung heißt das: Ein regelmäßiger Preis- und Qualitätsabgleich lohnt sich mehr als eine einmalige Modellentscheidung, weil neuere, kleinere Modelle ältere oft zu einem Bruchteil des Preises ersetzen.
Fazit: Welche Modellfamilie für welchen Workflow
| Workflow-Typ | Modellfamilie | Hosting-Pfad |
|---|---|---|
| Allgemeine Bürokommunikation, Zusammenfassungen | GPT-6 Sol oder Claude Sonnet | Standard-API oder EU-Endpunkt |
| Lange Dokumente, Vertragsanalyse, komplexes Reasoning | Claude Opus oder Fable | AWS Bedrock oder Google Vertex mit EU-Region |
| Multimodale Aufgaben (Text und Bild/Video) | Gemini | Google Vertex mit EU-Multiregion |
| EU-nativer Zugang, kein US-Anbieter gewünscht | Mistral | api.eu.mistral.ai |
| Sovereign, On-Premise, hohe Sicherheitsanforderungen | Aleph Alpha | On-Premise oder private EU-Infrastruktur |
| Vollständige Datenkontrolle, eigene Infrastruktur bereit | Open-Weight-Modelle (Mistral, Muse Glimmer, gpt-oss) | Eigenbetrieb |
Die Modellwahl ist eine Funktion des Workflows, nicht der Trendliste. Der sinnvolle Einstiegspunkt ist deshalb die Klärung der eigenen Datenklassen, nicht ein weiterer Benchmark: Welche Daten kommen in welchen Workflow, und welche Anforderungen stellen berufsrechtliche Vorgaben oder das europäische KI-Regelwerk daran?
Welche Datenklassen bei dir betroffen sind und welcher Hosting-Pfad zu deiner Compliance-Lage passt, klären wir im Kennenlerngespräch. Wie du überhaupt zum ersten passenden Anwendungsfall kommst, bevor die Modellwahl relevant wird, beschreibt der Beitrag KI-Use-Cases finden.