Getestete Kategorien
Wie schwer war jede Disziplin?
Modelle im Test
| Modell | Groesse (B) | Quant. | GGUF (GB) | VRAM (GB) | KV-Cache (GB) | Kontext | tok/s (⌀) | Antwortzeit | Thinking | Sampling | Erfolgsquote (⌀) | Score /100 |
|---|
Gewinner pro Disziplin
| Frage | Disziplin | 1. Platz | 2. Platz | 3. Platz |
|---|
Erfolgsquote pro Modell × Frage
Speed vs. Score — welches Modell für welche Anforderung
Jeder Punkt ist ein Modell. X-Achse: Generierungsgeschwindigkeit in Tokens/Sekunde. Y-Achse: Score /100 (Mittel der aktiven Judges). Punktgröße = VRAM-Verbrauch. Farbe = Runtime. Die orange Pareto-Frontier verbindet die Modelle, die für ihren Speed keinen besseren Score-Wettbewerber haben — alles unter dieser Linie ist strikt dominiert.
Quantisierung — was kostet Q4 wirklich?
Gleiche Modelle, gleiche 100 Aufgaben, gleiche Judges — nur die Quantisierung unterscheidet sich. Jede Zelle ist der Score /100 (Mittel der aktiven Judges) der jeweiligen Variante über 1000 Testläufe. Klick auf eine Zelle öffnet die Detail-Ansicht der Variante. Δ = Differenz zur BF16-Referenz der Zeile (fehlt BF16, zur höchsten vorhandenen Stufe).
Leaderboard
Lokale KI-Modelle im Test: die Ergebnisse in Kürze
Dieser LLM-Benchmark vergleicht 57 lokale KI-Modelle (0,8B bis 128B Parameter) und 77 Quantisierungs-Varianten auf 100 deutschen Business-Aufgaben — Dokumente auswerten, E-Mails schreiben, JSON liefern, Python-Code, Multi-Turn-Kontext. Jede Aufgabe läuft 10-mal, jede der über 130.000 Antworten wird von zwei unabhängigen KI-Judges bewertet (Stand 05.09.2026, Scoring v2.1, gegen 100 menschliche Urteile validiert).
Die 10 besten lokalen KI-Modelle 2026
| Rang | Modell | Score /100 |
|---|---|---|
| 1 | Qwen 3.5-27B Thinking | 93,3 |
| 2 | Qwen 3.5-35B-A3B Thinking | 92,6 |
| 3 | Qwen 3.5-9B Thinking | 91,3 |
| 4 | Qwen 3.8-27B | 90,5 |
| 5 | Qwen 3.6-35B-A3B Thinking | 90,5 |
| 6 | Qwen 3.6-35B-A3B (NInfer) | 90,5 |
| 7 | ThinkingCap-27B | 90,2 |
| 8 | Qwen 3.5-27B | 90,2 |
| 9 | Qwen 3.6-27B Thinking | 89,6 |
| 10 | Qwen 3.8-Flash-Next | 88,3 |
Q4 vs. BF16: Was kostet Quantisierung?
Q4_K_M kostet gegenüber BF16 im Mittel 0,13 von 100 Punkten — über 14 Modellpaare mit je 1000 Testläufen. Bei einem 27B-Modell liegt die komplette Leiter von Q2 (89,4) bis BF16 (90,8) in einem 2,5-Punkte-Band. Bei kleinen Modellen kippt es: ein 3B-Modell verliert mit Q2 rund 10 Punkte. Details im Tab Quantisierung.
Häufige Fragen
Welches Modell für wenig VRAM? Qwen 3.5-9B Thinking: Platz 3 im Gesamtfeld, braucht als Q4 nur ~8 GB. Für Laptops: Gemma 4-e4B (84,2).
Ist ein größeres Modell automatisch besser? Nein — gpt-oss-120b (85,5) liegt hinter Gemma 4-31B (86,8) mit einem Viertel der Parameter. Trainingsqualität schlägt Parameterzahl.
Wie zuverlässig sind die KI-Bewertungen? Zwei unabhängige Judge-Familien (Rangkorrelation 0,996), validiert gegen 100 von Hand geprüfte Antworten: 81–82 % Übereinstimmung — das Niveau, auf dem sich auch zwei menschliche Prüfer einigen. Details im Tab Gold-Set.
Hintergründe: Der Testbericht zur Runde 2 · Wie die KI-Judges validiert wurden · Frühere Stände: 18.08.2026, 24.08.2026