Cactus Compute, ein Y-Combinator-Startup aus San Francisco, hat am 18. September 2026 Needle 3 veröffentlicht, die dritte Generation seines kleinen Tool-Calling-Modells. Needle chattet nicht. Es entscheidet, welche Funktion ein Befehl auslösen soll, und passt dafür in eine einzelne Datei zwischen 8 und 29 Megabyte. Das Repository auf GitHub hat inzwischen rund 12.000 Sterne.
Kurzfassung
Needle 3 ist ein 29 bis 121 Millionen Parameter kleines Modell für Tool-Calling, Datenextraktion und Embeddings, das komplett auf einem Gerät läuft. Es schlägt auf engen Aufgaben Modelle, die zehnmal größer sind, bleibt aber auf breiteren Benchmarks und bei Extraktion klar hinter ihnen zurück.
Needle ist ein Small Language Model, das nicht chattet
Needle 3 kommt nicht als ein Modell, sondern als ein Satz Gewichte, den Cactus auf jede Tiefe zwischen 2 und 20 Layer zuschneidet, jede Tiefe für sich einsetzbar. Die 20-Layer-Version mit 121 Millionen Parametern wiegt als 2-Bit-quantisierte Datei 29 MB, die kleinste 4-Layer-Version mit 29 Millionen Parametern nur 8 MB (Model Card auf Hugging Face). Die Lizenz ist Apache 2.0, Needle ist also ein Open-Weight-Modell mit offenen Gewichten.
Dafür verzichtet Needle bewusst auf das, was ein normales Sprachmodell kann: frei antworten, Texte schreiben, zusammenfassen. Stattdessen macht es genau drei Dinge. Es wählt Funktionen aus und füllt deren Parameter, wobei zwei Anfragen zwei Aufrufe in der richtigen Reihenfolge ergeben und eine Anfrage ohne passendes Werkzeug eine leere Liste zurückgibt statt zu raten. Es extrahiert strukturierte Felder aus Text anhand eines vorgegebenen Schemas, abgesichert durch eine Decoding-Grammatik, die ein gültiges Ausgabeformat erzwingt. Und es erzeugt Text-Embeddings. Jede Antwort enthält die Funktionsaufrufe, eine kurze Begründung und einen Konfidenzwert.
Auf einem Raspberry Pi 5 liefert die 20-Layer-Version laut Cactus rund 400 Token pro Sekunde beim Decoding, die kleinste Tiefe bis zu 4.000, das Prefill liegt zwischen 1.000 und 10.000 Token pro Sekunde (Cactus-Blog). Das Modell läuft nativ auf macOS, Linux, Windows, Android, iOS, watchOS, tvOS und im Browser per WebAssembly, jeweils mit einer Engine unter 1 MB. Damit zielt Needle klar auf Geräte: Smartphones, Wearables, Raspberry Pi, Kameras, nicht auf den Server im Rechenzentrum.
Das Tempo ist hoch: Die erste Needle-Version (26 Millionen Parameter, destilliert aus Gemini 3.1 Flash-Lite) erschien im Mai 2026, Needle 2 mit 45 Millionen Parametern im August. Needle 3 bringt vor allem mehr Parameter, mehr Sprachen und die frei wählbare Tiefe.
Die Benchmarks zeigen, wo 121 Millionen Parameter reichen und wo nicht
Stand: September 2026. Die folgenden Zahlen stammen aus den offiziellen Benchmark-Grafiken im Needle-Repository, Genauigkeit in Prozent für Tool-Calling, Feld-F1 in Prozent für Extraktion. Needle 3 ist dabei die ausgelieferte 2-Bit-Binärdatei, die Vergleichsmodelle laufen laut Herstellerangabe in f16.
| Benchmark | DeepSeek V4 Flash (Cloud) | Needle 3 (121M) | LFM2.5 1.2B | Qwen3.5 0.8B | FunctionGemma 270M |
|---|---|---|---|---|---|
| Mobile Actions (961 Zeilen) | 88,4 % | 86,0 % | 82,4 % | 76,0 % | 65,1 % |
| DroidCall (200 Zeilen) | 60,5 % | 47,0 % | 35,5 % | 28,0 % | 16,5 % |
| BFCL v4 (3.641 Zeilen) | 77,2 % | 50,2 % | 62,0 % | 56,8 % | 46,6 % |
| SNIPS gold (Extraktion, 700 Zeilen) | 69,4 % | 30,2 % | 43,0 % | 35,0 % | 29,0 % |
Die ehrliche Lesart: Needle gewinnt auf Smartphone-typischen Befehlen (Mobile Actions, DroidCall) gegen Modelle, die bis zu zehnmal größer sind. Auf dem breiteren BFCL-v4-Benchmark und bei jeder gemessenen Extraktionsaufgabe liegt es dagegen hinter LFM2.5 und Qwen3.5, teils deutlich. Die Herstelleraussage, Needle halte bei Extraktion mit zwei- bis dreimal größeren Modellen mit, trifft nur auf FunctionGemma 270M zu, das selbst am unteren Ende der Tabelle steht. Der Gründer schreibt im Show-HN-Thread zum Release selbst, man gewinne nicht überall.
Wie gut das im echten Einsatz trägt, zeigte derselbe Thread: Ein Nutzer testete eine beiläufig formulierte Anfrage nach dem Badezimmerlicht und bekam falsche Aufrufe zurück: Statt das Licht einzuschalten, startete das Modell unter anderem den Staubsauger. Ein anderer hielt die Benchmark-Nähe zu DeepSeek V4 Flash für weit hergeholt. Der Gründer verwies darauf, dass die Demo mit einem voreingestellten Werkzeugsatz läuft, der für den eigenen Anwendungsfall angepasst werden muss.
Der Konfidenzwert ist der eigentlich interessante Teil
Interessanter als die Modellgröße ist, was Needle zu jedem Aufruf mitliefert: einen Konfidenzwert, der aus zwei Quellen gebildet wird, dem Minimum aus einem kalibrierten Kopf, der den fertigen Aufruf bewertet, und der Decoding-Wahrscheinlichkeit der Aufruf-Token (Cactus-Blog). Aufrufe unter einem Schwellenwert von 0,1 verwirft die Engine selbst und legt sie in ein separates Feld für unterdrückte Aufrufe.
Cactus schlägt dafür drei Bänder vor, die sich direkt auf einen Automatisierungsschritt übertragen lassen: über einem Schwellenwert ausführen, im mittleren Band den Aufruf samt Begründung zur Bestätigung zeigen, bei einer leeren Antwort ablehnen. Die Schwellenwerte hängen am Risiko der Aktion: Ein Lichtschalter verträgt laut Cactus-Beispiel bereits 0,5, eine Geldüberweisung braucht 0,9 und zusätzlich eine ausdrückliche Bestätigung. Das ist dieselbe Grundidee, die wir in Grenzen eines KI-Agenten technisch ziehen beschrieben haben, nur bei Needle als mitgelieferter Zahl statt als selbst gebautem Klassifikator.
Zwei Einschränkungen gehören zu diesem Wert dazu. Erstens ist der Kopf, der ihn berechnet, auf dem Basismodell kalibriert. Angepasste Gewichte liefern laut Hersteller gar keinen Konfidenzwert. Zweitens rät Cactus bei nicht-englischen Sprachen selbst zur Vorsicht, korrekte spanische Aufrufe wurden in eigenen Messungen mit einem Konfidenzwert von 0,0 beobachtet. Für die neu hinzugekommene deutsche Sprachunterstützung heißt das: erst einmal selbst nachmessen, bevor der Wert für eine Automatisierungsentscheidung verwendet wird.
Telemetrie läuft standardmäßig mit, laut Cactus anonymisiert (Funktionsname, Version, Betriebssystem, zufällige Installations-ID, nie Prompts oder Ausgaben) und abschaltbar über NEEDLE_TELEMETRY=0 oder DO_NOT_TRACK=1.
Was das für Automatisierung im Mittelstand heißt
Needle selbst zielt auf Geräte, nicht auf das Backoffice: Smartphones, Wearables, Raspberry Pi, Kameras. Für einen deutschen Mittelständler, der Rechnungen, E-Mails oder Vorgänge verarbeitet, ist deshalb nicht das Modell selbst relevant, sondern das Muster dahinter. Routing- und Extraktionsschritte innerhalb eines Workflows brauchen nicht zwingend ein Frontier-Modell. Ein kleiner Spezialist übernimmt die einfachen, klar umrissenen Fälle vorne im Prozess, ein großes Modell die schweren Fälle, und ein Mensch prüft das mittlere Konfidenzband dazwischen.
Den gleichen Gedanken, ein spezialisiertes Modell entscheidet statt zu schreiben, haben wir bereits bei TypeSafe Jev eingeordnet. Gartner erwartet laut InfoWorld, dass Unternehmen bis 2027 dreimal so viele kleine, aufgabenspezifische Modelle einsetzen wie große LLMs.
Wer heute schon zwischen Cloud-Modellen wählt, findet die Kriterien dafür im LLM Vergleich für Unternehmen. Ein Modell für jeden Schritt zu betreiben, egal ob winzig auf dem Gerät oder groß in der Cloud, bleibt aber eine Frage eigener Infrastruktur, dazu mehr in Private KI-Infrastruktur für Unternehmen. Und wo Tool-Calling in einen echten KI-Agenten eingebettet ist, entscheidet ohnehin nicht das kleinste verfügbare Modell, sondern die Frage, welcher Schritt wie viel Sicherheit braucht.