Cloudflare hat am 1. Oktober 2026 mit Clef und Clef-flash zwei Entscheidungsmodelle auf Workers AI veröffentlicht. Laut Cloudflare-Blog liefern sie auf eine Eingabe eine Wahrscheinlichkeit je vorgegebener Option. Die Gewichte liegen unter Apache 2.0 auf Hugging Face. Anders als das in den USA betriebene Jev lässt sich Clef damit auf eigener Infrastruktur betreiben.
Kurzfassung
- Cloudflare hat am 1. Oktober 2026 die Entscheidungsmodelle Clef und Clef-flash mit offenen Gewichten unter Apache 2.0 veröffentlicht.
- Clef soll laut Cloudflare im Median 209,3 Millisekunden brauchen und 0,24 US-Dollar je Million Eingabe-Token kosten (Stand: Oktober 2026), eine unabhängige Messung fehlt.
- Das betrifft Unternehmen, die Zuordnungen und Vorsortierungen automatisieren und dafür Daten nicht an einen US-Dienst geben wollen.
Was Cloudflare vorgestellt hat
Es gibt zwei Modelle: Clef basiert auf Qwen3.8-27B mit einem Vision-Encoder, Clef-flash auf einem Qwen-Modell mit 9 Milliarden Parametern. Beide hat Cloudflare nachtrainiert, wie die Modellkarten auf Hugging Face für Clef und Clef-flash beschreiben. Die Workers-AI-Dokumentation führt das Modell ebenfalls.
Die Eingabe besteht aus einem Zustand (Text, JSON oder Bilder) und bis zu 64 typisierten Fragen. Es gibt drei Fragetypen: noul für Ja/Nein als Wahrscheinlichkeit, choice für eine Auswahl aus Optionen mit Kriterien und score für eine Ordinalskala. Das Ergebnis ist eine Wahrscheinlichkeit je Option, die Optionen werden parallel bewertet statt nacheinander erzeugt. Cloudflares Beispiel ist ein Support-Ticket mit den Fragen Dringlichkeit, Team und Schweregrad. Übertragen auf eine deutsche Anfrage sieht der Aufruf in der Syntax aus Cloudflares Beispiel so aus:
{
"model": "clef",
"state": "Der Checkout schlägt seit einer Stunde bei allen Kunden fehl.",
"questions": {
"dringend": { "type": "noul", "instructions": "Ist die Anfrage dringend?" },
"team": {
"type": "choice",
"instructions": "Welches Team übernimmt die Anfrage?",
"criteria": {
"buchhaltung": "Zahlungen, Rechnungen, Erstattungen",
"technik": "Ausfälle, Fehler, Konfiguration",
"vertrieb": "Tarife und Upgrades"
}
},
"schwere": {
"type": "score",
"instructions": "Wie stark sind Kunden betroffen?",
"criteria": ["Keine Auswirkung", "Gering", "Erheblich", "Kritisch"]
}
}
}
Zurück kommt für jede Frage eine Wahrscheinlichkeit je Option.
Clef ist laut Cloudflare API-kompatibel zu Jev, dem Modell von TypeSafe. Wie diese Modellklasse funktioniert, steht im Beitrag zu Jev. Das Kontextfenster umfasst bei Clef 64.000 Token gegenüber 32.000 bei Jev, außerdem akzeptiert es Bilder. Cloudflare versteht Clef als Ergänzung zu Sprachmodellen: Es leitet weiter, eskaliert oder übergibt an einen Menschen.
Was an den Zahlen belegt ist
Alle Leistungsangaben stammen von Cloudflare selbst. Die mediane Latenz soll bei 209,3 Millisekunden für Clef, 38,8 für Clef-flash und 524,1 für Jev liegen. Außerdem soll Clef den Jev Decision Index anführen und Jev auf Typesafes Eval-Suite in drei von vier Bereichen schlagen. Das sind Herstellerbenchmarks, eine unabhängige Messung gibt es nicht.
Ein internes Beispiel nennt Cloudflare aus der Threat-Intelligence-Abteilung, die Domains klassifiziert: etwa 95 Prozent Mode, 85 Prozent E-Commerce und unter einem Prozent Phishing. Das soll 2,2 Sekunden gedauert haben, gpt-oss-120b brauchte laut Cloudflare 4,7 Sekunden und gab nur zwei Klassen zurück. Zum Training teilte Cloudflare mit, es nutze Label-Smoothed-Cross-Entropy, Brier-Loss zur Kalibrierung und RLCD, ein Verfahren von Typesafe. Wie gut die Wahrscheinlichkeiten tatsächlich kalibriert sind, zeigt erst ein Test mit eigenen Daten.
| Merkmal | Clef | Clef-flash | Jev |
|---|---|---|---|
| Latenz, Median (Hersteller) | 209,3 ms | 38,8 ms | 524,1 ms |
| Kontextfenster | 64.000 Token | nicht genannt | 32.000 Token |
| Bildeingabe | ja | nicht genannt | nein |
| Gewichte | offen, Apache 2.0 | offen, Apache 2.0 | nicht veröffentlicht |
| Preis je 1 Mio. Eingabe-Token | 0,24 USD | nicht genannt | 0,042 USD, Ausgabe kostenlos |
| Betrieb | Workers AI, selbst | Workers AI, selbst | US-Westküste, keine EU-Residenz |
Preise gelten laut Anbieter, Stand: Oktober 2026. Ein gerechnetes Beispiel, keine Messung: Clef kostet auf Workers AI je Eingabe-Token etwa das Sechsfache von Jev, dafür bringt es mehr Kontext, Bildeingabe und offene Gewichte mit. Ob sich der Aufpreis lohnt, hängt vom Vorgang ab, bei Clef-flash nennen die Quellen keinen Preis. Zur deutschen Sprache steht in den Modellkarten nichts, Deutsch ist nicht dokumentiert.
Offene Gewichte ändern die Lage
Im Beitrag zu Jev stand das Verdikt: nicht einsetzbar in Deutschland, weil der Betrieb an der US-Westküste läuft und es keine Zusage zur EU-Datenresidenz gibt. Bei Clef fällt dieses Hindernis weg, sofern die Gewichte selbst betrieben werden. Laut den Modellkarten stehen sie auf Hugging Face unter Apache 2.0 bereit und laufen mit vLLM.
Auf Workers AI sieht es anders aus. Die Ankündigung sagt nichts dazu, die Inferenz auf die EU zu beschränken, und Cloudflare, Inc. ist ein US-Unternehmen. Andre Loreth hält den Eigenbetrieb deshalb für den realistischen Weg, sobald personenbezogene Daten in der Eingabe stehen. Welche Betriebsformen dafür infrage kommen, beschreibt der Beitrag zur privaten KI-Infrastruktur.
Prüffragen vor dem Einsatz
Bevor du einen Ablauf auf Clef aufbaust, klärst du vier Punkte. Teste zuerst deutsche Vorgänge selbst, denn ohne dokumentierte Sprachunterstützung zählt nur dein eigenes Ergebnis. Lege danach die Optionsliste samt Auffangoption für unklare Fälle fest, wie im Beitrag zu den Anwendungsfällen von Entscheidungsmodellen beschrieben.
Setze dann eine Schwelle für die Wahrscheinlichkeit und lege fest, wer die Fälle darunter bekommt. Je riskanter die Aktion, desto höher gehört die Schwelle, die Mechanik steht in KI-Agenten Grenzen ziehen. Entscheide zuletzt, wo das Modell läuft, und halte das vor dem ersten Test fest.
Einordnung
Der eigentliche Unterschied zu Jev liegt in den offenen Gewichten, mit denen sich Clef auf eigener Infrastruktur betreiben lässt. Die Geschwindigkeits- und Qualitätsangaben bleiben Herstellerwerte ohne unabhängige Messung. Dazu kommt die offene Frage zur deutschen Sprache. Andre Loreth sieht Clef deshalb als Kandidaten für einen Test auf eigener Infrastruktur, nicht als fertige Antwort für Prozesse mit deutschen Dokumenten.