Zum Inhalt springen

Cloudflare Clef: Entscheidungsmodell mit offenen Gewichten

Cloudflare hat mit Clef und Clef-flash zwei Entscheidungsmodelle mit offenen Gewichten veröffentlicht. Was belegt ist und was das für den Eigenbetrieb heißt.

Andre Loreth5 Min. Lesezeit
Teilen
Eine Sortiermaschine auf einer Werkbank in einem eigenen Raum verteilt eingehende Dokumente auf zwei Stapel

Cloudflare hat am 1. Oktober 2026 mit Clef und Clef-flash zwei Entscheidungsmodelle auf Workers AI veröffentlicht. Laut Cloudflare-Blog liefern sie auf eine Eingabe eine Wahrscheinlichkeit je vorgegebener Option. Die Gewichte liegen unter Apache 2.0 auf Hugging Face. Anders als das in den USA betriebene Jev lässt sich Clef damit auf eigener Infrastruktur betreiben.

Kurzfassung

  • Cloudflare hat am 1. Oktober 2026 die Entscheidungsmodelle Clef und Clef-flash mit offenen Gewichten unter Apache 2.0 veröffentlicht.
  • Clef soll laut Cloudflare im Median 209,3 Millisekunden brauchen und 0,24 US-Dollar je Million Eingabe-Token kosten (Stand: Oktober 2026), eine unabhängige Messung fehlt.
  • Das betrifft Unternehmen, die Zuordnungen und Vorsortierungen automatisieren und dafür Daten nicht an einen US-Dienst geben wollen.

Was Cloudflare vorgestellt hat

Es gibt zwei Modelle: Clef basiert auf Qwen3.8-27B mit einem Vision-Encoder, Clef-flash auf einem Qwen-Modell mit 9 Milliarden Parametern. Beide hat Cloudflare nachtrainiert, wie die Modellkarten auf Hugging Face für Clef und Clef-flash beschreiben. Die Workers-AI-Dokumentation führt das Modell ebenfalls.

Die Eingabe besteht aus einem Zustand (Text, JSON oder Bilder) und bis zu 64 typisierten Fragen. Es gibt drei Fragetypen: noul für Ja/Nein als Wahrscheinlichkeit, choice für eine Auswahl aus Optionen mit Kriterien und score für eine Ordinalskala. Das Ergebnis ist eine Wahrscheinlichkeit je Option, die Optionen werden parallel bewertet statt nacheinander erzeugt. Cloudflares Beispiel ist ein Support-Ticket mit den Fragen Dringlichkeit, Team und Schweregrad. Übertragen auf eine deutsche Anfrage sieht der Aufruf in der Syntax aus Cloudflares Beispiel so aus:

{
	"model": "clef",
	"state": "Der Checkout schlägt seit einer Stunde bei allen Kunden fehl.",
	"questions": {
		"dringend": { "type": "noul", "instructions": "Ist die Anfrage dringend?" },
		"team": {
			"type": "choice",
			"instructions": "Welches Team übernimmt die Anfrage?",
			"criteria": {
				"buchhaltung": "Zahlungen, Rechnungen, Erstattungen",
				"technik": "Ausfälle, Fehler, Konfiguration",
				"vertrieb": "Tarife und Upgrades"
			}
		},
		"schwere": {
			"type": "score",
			"instructions": "Wie stark sind Kunden betroffen?",
			"criteria": ["Keine Auswirkung", "Gering", "Erheblich", "Kritisch"]
		}
	}
}

Zurück kommt für jede Frage eine Wahrscheinlichkeit je Option.

Clef ist laut Cloudflare API-kompatibel zu Jev, dem Modell von TypeSafe. Wie diese Modellklasse funktioniert, steht im Beitrag zu Jev. Das Kontextfenster umfasst bei Clef 64.000 Token gegenüber 32.000 bei Jev, außerdem akzeptiert es Bilder. Cloudflare versteht Clef als Ergänzung zu Sprachmodellen: Es leitet weiter, eskaliert oder übergibt an einen Menschen.

Was an den Zahlen belegt ist

Alle Leistungsangaben stammen von Cloudflare selbst. Die mediane Latenz soll bei 209,3 Millisekunden für Clef, 38,8 für Clef-flash und 524,1 für Jev liegen. Außerdem soll Clef den Jev Decision Index anführen und Jev auf Typesafes Eval-Suite in drei von vier Bereichen schlagen. Das sind Herstellerbenchmarks, eine unabhängige Messung gibt es nicht.

Ein internes Beispiel nennt Cloudflare aus der Threat-Intelligence-Abteilung, die Domains klassifiziert: etwa 95 Prozent Mode, 85 Prozent E-Commerce und unter einem Prozent Phishing. Das soll 2,2 Sekunden gedauert haben, gpt-oss-120b brauchte laut Cloudflare 4,7 Sekunden und gab nur zwei Klassen zurück. Zum Training teilte Cloudflare mit, es nutze Label-Smoothed-Cross-Entropy, Brier-Loss zur Kalibrierung und RLCD, ein Verfahren von Typesafe. Wie gut die Wahrscheinlichkeiten tatsächlich kalibriert sind, zeigt erst ein Test mit eigenen Daten.

MerkmalClefClef-flashJev
Latenz, Median (Hersteller)209,3 ms38,8 ms524,1 ms
Kontextfenster64.000 Tokennicht genannt32.000 Token
Bildeingabejanicht genanntnein
Gewichteoffen, Apache 2.0offen, Apache 2.0nicht veröffentlicht
Preis je 1 Mio. Eingabe-Token0,24 USDnicht genannt0,042 USD, Ausgabe kostenlos
BetriebWorkers AI, selbstWorkers AI, selbstUS-Westküste, keine EU-Residenz

Preise gelten laut Anbieter, Stand: Oktober 2026. Ein gerechnetes Beispiel, keine Messung: Clef kostet auf Workers AI je Eingabe-Token etwa das Sechsfache von Jev, dafür bringt es mehr Kontext, Bildeingabe und offene Gewichte mit. Ob sich der Aufpreis lohnt, hängt vom Vorgang ab, bei Clef-flash nennen die Quellen keinen Preis. Zur deutschen Sprache steht in den Modellkarten nichts, Deutsch ist nicht dokumentiert.

Offene Gewichte ändern die Lage

Im Beitrag zu Jev stand das Verdikt: nicht einsetzbar in Deutschland, weil der Betrieb an der US-Westküste läuft und es keine Zusage zur EU-Datenresidenz gibt. Bei Clef fällt dieses Hindernis weg, sofern die Gewichte selbst betrieben werden. Laut den Modellkarten stehen sie auf Hugging Face unter Apache 2.0 bereit und laufen mit vLLM.

Auf Workers AI sieht es anders aus. Die Ankündigung sagt nichts dazu, die Inferenz auf die EU zu beschränken, und Cloudflare, Inc. ist ein US-Unternehmen. Andre Loreth hält den Eigenbetrieb deshalb für den realistischen Weg, sobald personenbezogene Daten in der Eingabe stehen. Welche Betriebsformen dafür infrage kommen, beschreibt der Beitrag zur privaten KI-Infrastruktur.

Prüffragen vor dem Einsatz

Bevor du einen Ablauf auf Clef aufbaust, klärst du vier Punkte. Teste zuerst deutsche Vorgänge selbst, denn ohne dokumentierte Sprachunterstützung zählt nur dein eigenes Ergebnis. Lege danach die Optionsliste samt Auffangoption für unklare Fälle fest, wie im Beitrag zu den Anwendungsfällen von Entscheidungsmodellen beschrieben.

Setze dann eine Schwelle für die Wahrscheinlichkeit und lege fest, wer die Fälle darunter bekommt. Je riskanter die Aktion, desto höher gehört die Schwelle, die Mechanik steht in KI-Agenten Grenzen ziehen. Entscheide zuletzt, wo das Modell läuft, und halte das vor dem ersten Test fest.

Einordnung

Der eigentliche Unterschied zu Jev liegt in den offenen Gewichten, mit denen sich Clef auf eigener Infrastruktur betreiben lässt. Die Geschwindigkeits- und Qualitätsangaben bleiben Herstellerwerte ohne unabhängige Messung. Dazu kommt die offene Frage zur deutschen Sprache. Andre Loreth sieht Clef deshalb als Kandidaten für einen Test auf eigener Infrastruktur, nicht als fertige Antwort für Prozesse mit deutschen Dokumenten.

Dieser Artikel ist mit Unterstützung künstlicher Intelligenz entstanden. Bei dem, was wir hier machen, wäre alles andere seltsam gewesen.

Teilen

NeuGoogle

Mach uns zu deiner bevorzugten Quelle

Google lässt dich festlegen, welche Seiten in deinen Suchergebnissen weiter oben stehen sollen. Markierst du uns als bevorzugte Quelle, tauchen unsere Artikel bei dir zuverlässiger auf.

Bei Google hinzufügen

Noch offene Fragen?

Clef ist ein von Cloudflare am 1. Oktober 2026 veröffentlichtes Entscheidungsmodell, das auf eine Eingabe keinen Text, sondern eine Wahrscheinlichkeit je vorgegebener Option zurückgibt. Es gibt zwei Varianten, Clef und Clef-flash, die Gewichte liegen unter Apache 2.0 auf Hugging Face. Laut Modellkarte gibt es keine freie Textgenerierung und kein Parsen der Ausgabe.

Beide Modelle liefern typisierte Entscheidungen mit Wahrscheinlichkeit, Clef ist laut Cloudflare API-kompatibel zu Jev. Clef verarbeitet laut Modellkarte 64.000 statt 32.000 Token und nimmt auch Bilder an. Der wichtigste Unterschied für Unternehmen: Die Gewichte von Clef sind offen und lassen sich selbst betreiben.

Datenschutzkonform ausgestaltbar ist der Eigenbetrieb der offenen Gewichte auf eigener oder europäischer Infrastruktur. Für Workers AI nennt Cloudflare in der Ankündigung keine Beschränkung der Inferenz auf die EU, und Cloudflare, Inc. ist ein US-Unternehmen. Bei personenbezogenen Daten ist deshalb der Eigenbetrieb der realistische Weg.

Ob Clef Deutsch zuverlässig verarbeitet, ist offen, denn die Modellkarte dokumentiert keine Sprachunterstützung für Deutsch. Basis sind Qwen-Modelle, die laut Cloudflare nachtrainiert wurden. Ein Test mit eigenen deutschen Vorgängen ist daher Pflicht, bevor ein Ablauf darauf aufbaut.

Du planst gerade eine KI-Automatisierung?

Wir gehen deinen Plan gemeinsam durch und sagen dir, wo wir anfangen würden.

Kostenloses Kennenlerngespräch

30 Minuten. Danach weißt du, welche drei Prozesse bei dir zuerst dran sind.

Lieber erst schreiben? E-Mail schreiben