Nachtrag zu meinem Beitrag über Kev und snapjudge: Ich hatte angekündigt, Kev-4B auf denselben 114 deutschen Entscheidungen laufen zu lassen. Hier ist der Vergleich. Setup - Kev-4B (jaredpalmer/kev-4b, Apache 2.0, Basis Qwen3.5-4B-Base plus Adapter), bf16, auf MLX, Server laut README: uv sync --extra serve, dann python -m kev.serve --run jaredpalmer/kev-4b --port 8009. Download rund 8 GB. Ich habe den Kev-Code vorher nach Netzwerk- und Exec-Aufrufen durchsucht: außer dem Download der Gewichte war nichts Auffälliges dabei. - Testsatz: 52 deutsche Kurztexte, 114 Entscheidungen (Mail: Kategorie, Dringlichkeit, Ton, Phishing; Mieter: Anliegen, Notfall; Konto: Kategorie). - Gleiches Skript (eval/run_eval.py) und gleiche Fragen für alle Modelle. Qwen in 4 Bit und im Prozess gerechnet, Kev in bf16 über die HTTP-Schnittstelle (/v1/systemone). Die Latenzen sind deshalb nicht direkt vergleichbar, die Trefferquoten schon. Ergebnis, gesamt Modell: Trefferquote | mittlere Sicherheit | ECE | p ≥ 0,9: Anteil / richtig | Median-Latenz (Kev über HTTP, Qwen im Prozess) - Kev-4B: 91,2 % | 80,0 % | 0,119 | 33 % / 100 % | 319 ms - Qwen3.5-4B: 93,9 % | 94,3 % | 0,044 | 84 % / 99 % | 182 ms - Qwen3.5-9B: 93,0 % | 94,0 % | 0,048 | 85 % / 99 % | 334 ms - Qwen3.6-35B-A3B: 95,6 % | 96,3 % | 0,016 | 89 % / 99 % | 242 ms - Qwen3.8-27B: 96,5 % | 94,5 % | 0,035 | 85 % / 99 % | 1059 ms Die 95-%-Intervalle bei n = 114: Kev 84,6 bis 95,2 %, Qwen3.5-4B 87,9 bis 97,0 %. Der Unterschied zum 4B sind drei Entscheidungen und liegt innerhalb der Streuung. Je Frage (Trefferquote) - konto.kategorie: Kev 90,0 % | Qwen3.5-4B 85,0 % - mail.dringend: 100 % | 100 % - mail.kategorie: 88,2 % | 94,1 % - mail.phishing: 94,1 % | 94,1 % - mail.ton: 100 % | 86,7 % - mieter.anliegen: 66,7 % | 100 % - mieter.notfall: 100 % | 100 % Was dahintersteckt - Kev ist deutlich vorsichtiger. Mit p ≥ 0,9 entscheidet es nur 33 % der Fälle automatisch (alle richtig), das Qwen3.5-4B 84 % (99 % richtig). Mit niedrigerer Schwelle holt Kev auf: p ≥ 0,8 sind 61 % der Fälle, p ≥ 0,7 sind 75 %, beide Male alle richtig; p ≥ 0,6 sind 86 % mit 98 % richtig. Die Schwelle gehört also zum Modell und muss gemessen werden.