Zum Inhalt springen

DeepSeek V4.1 Flash: offene Gewichte, deutsche Datenschützer prüfen

DeepSeek hat V4.1 Flash veröffentlicht: offene Gewichte, niedriger Preis. Mehrere deutsche Datenschutzbehörden prüfen den Einsatz der gehosteten API.

Andre Loreth5 Min. Lesezeit
Teilen
Gezeichnete offene Kiste mit frei verstreuten gleichen Würfeln links, ein einzelnes Serverregal hinter einem niedrigen Zaun aus kurzen Pfosten rechts

DeepSeek hat am 10. September 2026 DeepSeek V4.1 Flash veröffentlicht, ein Open-Weight-Modell (offene Gewichte: die trainierten Parameter sind frei verfügbar) mit 552 Milliarden Parametern unter MIT-Lizenz. Laut The Next Web übernimmt es seit dem 14. September alle Anfragen des bisherigen Flaggschiffs V4-Pro, zum gleichen, deutlich günstigeren Preis. Für deutsche Unternehmen bleibt dabei offen, ob sie DeepSeeks eigene API überhaupt datenschutzkonform nutzen dürfen.

Kurzfassung

  • DeepSeek hat V4.1 Flash veröffentlicht, ein Open-Weight-Modell mit 552 Milliarden Parametern unter MIT-Lizenz, das seit dem 14. September 2026 das bisherige Flaggschiff V4-Pro vollständig ersetzt.
  • Die Ausgabe kostet laut DeepSeek 0,60 US-Dollar pro 1 Million Token im Nebenzeitfenster, in Spitzenzeiten das Doppelte (Stand: Oktober 2026).
  • Das betrifft Unternehmen, die mit den offenen Gewichten selbst arbeiten wollen, denn mehrere deutsche Landesdatenschutzbehörden prüfen bereits den Einsatz der gehosteten API.

Was DeepSeek veröffentlicht hat

Das Modell firmiert unter dem Namen DeepSeek-V4.1-Flash und ist laut der Modellkarte auf Hugging Face als MoE-Architektur (Mixture of Experts: mehrere spezialisierte Teilmodelle statt eines einzelnen großen) mit insgesamt 552 Milliarden Parametern aufgebaut. Für eine einzelne Anfrage sind davon laut The Next Web nur rund 8 Milliarden Parameter beim Lesen der Eingabe aktiv und 16 Milliarden beim Schreiben der Ausgabe. Das hält die laufenden Rechenkosten niedrig, obwohl das Modell insgesamt groß bleibt. Das Kontextfenster reicht laut Hersteller bis zu 1 Million Token, trainiert wurde es auf 45 Billionen Token.

Mit dem Start von V4.1 Flash hat DeepSeek sein bisheriges Flaggschiff V4-Pro eingestellt. Seit dem 14. September 2026 leitet DeepSeek laut TechNode alle V4-Pro-Anfragen automatisch an V4.1 Flash weiter und berechnet dafür den günstigeren Flash-Tarif, bis ein Nachfolger namens V4.1-Pro erscheint. Einen Termin dafür gibt es nach Angaben von The Next Web noch nicht.

Preis pro Token deutlich gesenkt

DeepSeek hat die Flash-Preise zum Start von V4.1 um rund 32 Prozent gesenkt. Die folgenden Werte sind Herstellerangaben, umgerechnet von Yuan in US-Dollar, Stand Oktober 2026:

PreispositionNebenzeitSpitzenzeit*
Eingabe, Cache-Miss0,14 USD0,28 USD
Eingabe, Cache-Hit0,003 USD0,006 USD
Ausgabe0,60 USD1,20 USD

*Spitzenzeit: werktags 1 bis 4 und 6 bis 10 Uhr UTC, laut TechNode.

Zum Vergleich: GPT-6.1 Sol kostet durchgehend 2 US-Dollar Eingabe und 10 US-Dollar Ausgabe je 1 Million Token. DeepSeek V4.1 Flash unterbietet das selbst zur Spitzenzeit um mehr als das Vierfache bei der Ausgabe. Einen Überblick über alle aktuellen Modelle und ihre Preise führt der LLM-Vergleich für Unternehmen.

Offene Gewichte ohne einfachen Eigenbetrieb

Die Gewichte von V4.1 Flash stehen laut DeepSeek unter MIT-Lizenz offen auf Hugging Face zum Download, das Modell lässt sich damit grundsätzlich auf eigener Hardware betreiben. Ein Open-Weight-Modell bedeutet aber nicht automatisch einen einfachen Eigenbetrieb, Trainingsdaten und -code bleiben bei DeepSeek weiterhin unter Verschluss.

Ein gerechnetes Beispiel, keine Messung aus einem Kundenprojekt: Allein die 552 Milliarden Parameter belegen bei 16-Bit-Genauigkeit rund 1,1 Terabyte Grafikspeicher, bei einer gröberen 4-Bit-Quantisierung noch etwa 280 Gigabyte, jeweils ohne den zusätzlichen Speicher für Kontext und laufende Anfragen. Das sprengt eine einzelne Workstation und verlangt einen Verbund mehrerer Hochleistungs-Grafikkarten. Für die meisten Mittelständler heißt Eigenbetrieb deshalb in der Praxis: eine verwaltete Private Cloud oder eine hybride Infrastruktur bei einem Partner, nicht der Kauf eigener Server. Welcher der drei Deploymentpfade dafür passt, beschreibt Private KI-Infrastruktur für Unternehmen.

Datenschutz der API ungeklärt

Wer die offenen Gewichte selbst betreibt, entscheidet selbst, wo die Daten verarbeitet werden. Anders bei DeepSeeks eigener API: Sie verarbeitet Anfragen laut e-recht24 auf Servern in China, einem Land ohne ein der DSGVO gleichwertiges Datenschutzniveau. Mehrere deutsche Landesdatenschutzbehörden, darunter Niedersachsen, Berlin, Baden-Württemberg und Hessen, haben laut e-recht24 deshalb Prüfverfahren gegen DeepSeek eingeleitet. Eine EU-Vertretung hat der Anbieter bislang nicht bestellt, einen Auftragsverarbeitungsvertrag, wie ihn jeder KI-Anbieter mit Sitz außerhalb der EU für die datenschutzkonforme Verarbeitung personenbezogener Daten braucht, bietet DeepSeek nach den vorliegenden Angaben nicht an. Was einen solchen Vertrag ausmacht und wann er zwingend ist, erklärt Auftragsverarbeitungsvertrag mit KI-Anbietern.

Ein formelles Verbot gibt es in Deutschland bislang nicht, die italienische Datenschutzbehörde Garante hat den Zugang zur DeepSeek-App dagegen bereits gesperrt. Für Unternehmen bleibt die Lage ungeklärt, solange die laufenden Prüfverfahren kein Ergebnis haben. Wie sich Verarbeitungsort und Vertragspartner bei mehreren Anbietern grundsätzlich auseinanderhalten lassen, beschreibt KI und EU-Datenresidenz.

Einordnung

Andre Loreth sieht im niedrigen Preis von V4.1 Flash keinen Freibrief für die gehostete API. Wer die Kostenvorteile nutzen will, ohne die eigene Datenschutzlage zu riskieren, lädt die offenen Gewichte herunter und betreibt sie in einer eigenen oder verwalteten Umgebung innerhalb der EU, statt Anfragen an DeepSeeks chinesische Server zu schicken. Der Hardwarebedarf dafür ist real, ein Modell dieser Größe läuft nicht auf einem einzelnen Server, er ist aber mit den etablierten Deploymentpfaden für private KI-Infrastruktur lösbar.

Die von DeepSeek selbst genannten Benchmark- und Effizienzangaben sind bislang nicht unabhängig geprüft. Offen bleibt zudem, wann der angekündigte Nachfolger V4.1-Pro erscheint und ob er dieselbe Preislogik fortsetzt. Welche Rolle europäische Anbieter als Alternative zu US- und chinesischen Modellen tatsächlich spielen können, ordnet Digitale Souveränität bei KI ein, die aktuelle Finanzierungsrunde eines der größten europäischen Anbieter beschreibt Mistral holt 3 Milliarden Euro.

Dieser Artikel ist mit Unterstützung künstlicher Intelligenz entstanden. Bei dem, was wir hier machen, wäre alles andere seltsam gewesen.

Teilen

NeuGoogle

Mach uns zu deiner bevorzugten Quelle

Google lässt dich festlegen, welche Seiten in deinen Suchergebnissen weiter oben stehen sollen. Markierst du uns als bevorzugte Quelle, tauchen unsere Artikel bei dir zuverlässiger auf.

Bei Google hinzufügen

Noch offene Fragen?

DeepSeek V4.1 Flash ist ein am 10. September 2026 veröffentlichtes Open-Weight-Modell des chinesischen Anbieters DeepSeek mit 552 Milliarden Parametern in einer MoE-Architektur. Die Gewichte stehen unter MIT-Lizenz frei zum Download, seit dem 14. September 2026 ersetzt es das bisherige Flaggschiff V4-Pro vollständig.

Der Preis ist die Gebühr, die DeepSeek je 1 Million verarbeiteter Token berechnet. Im Nebenzeitfenster kostet die Ausgabe laut Hersteller 0,60 US-Dollar und die Eingabe 0,14 US-Dollar je 1 Million Token, in Spitzenzeiten (werktags 1 bis 4 und 6 bis 10 Uhr UTC) jeweils das Doppelte (Stand: Oktober 2026).

Open-Weight heißt, dass die trainierten Modellparameter frei zugänglich sind, nicht zwingend auch Trainingsdaten oder -code. DeepSeek V4.1 Flash ist in diesem Sinn offen: Die Gewichte stehen unter MIT-Lizenz auf Hugging Face bereit und lassen sich auf eigener Hardware betreiben.

Datenschutzkonform ausgestaltbar ist das nach aktuellem Stand nicht gesichert. DeepSeeks eigene API verarbeitet Anfragen auf Servern in China, mehrere deutsche Landesdatenschutzbehörden prüfen den Einsatz, und eine EU-Vertretung sowie ein Auftragsverarbeitungsvertrag fehlen bislang. Die offenen Gewichte lassen sich dagegen innerhalb der EU selbst betreiben.

Ein gerechnetes Beispiel, keine Messung: Allein die Modellgewichte belegen bei 16-Bit-Genauigkeit rund 1,1 Terabyte und bei 4-Bit-Quantisierung noch etwa 280 Gigabyte Grafikspeicher, ohne Zusatzspeicher für Kontext und laufende Anfragen. Das verlangt einen Verbund mehrerer Hochleistungs-Grafikkarten, für die meisten Mittelständler praktisch nur über eine verwaltete Private Cloud oder eine hybride Infrastruktur.

Du planst gerade eine KI-Automatisierung?

Wir gehen deinen Plan gemeinsam durch und sagen dir, wo wir anfangen würden.

Kostenloses Kennenlerngespräch

30 Minuten. Danach weißt du, welche drei Prozesse bei dir zuerst dran sind.

Lieber erst schreiben? E-Mail schreiben