Lade Benchmark-Daten
Testdaten werden vorbereitet …
winiecki.ai Potenzialcheck

Local LLM Benchmark

Testrunde 2 · Scoring v2.1 · Stand 05.09.2026 · 0 Modelle · 0 Runs · 100 Fragen · Judge:
18.08. 24.08. 05.09. · v2.1
Judge:

Getestete Kategorien

10 Fragen aus verschiedenen Disziplinen. Jedes Modell beantwortet jede Frage n-mal (n aus Frage-YAML). Klick auf einen Chip springt zur Frage im „Gewinner pro Disziplin"-Block darunter.

Wie schwer war jede Disziplin?

⌀ Score aller Modelle pro Disziplin (0–10). Sortiert von schwer nach leicht. Zeigt sofort, wo die Modelle als Kohorte scheitern.

Modelle im Test

(Legende Thinking: ON = fest an, OFF = im Test aus, n/a = nicht verfügbar)
Modell Groesse (B) Quant. GGUF (GB) VRAM (GB) KV-Cache (GB) Kontext tok/s (⌀) Antwortzeit Thinking Sampling Erfolgsquote (⌀) Score /100

Gewinner pro Disziplin

Top 3 pro Frage. Basis: ⌀ Score /10 (Judge- und deterministische Bewertung). Modelle ohne Bewertung erscheinen nicht. Filter „baked-in ausblenden" gilt auch hier.
Frage Disziplin 1. Platz 2. Platz 3. Platz

Erfolgsquote pro Modell × Frage

Klick auf eine Zelle: Antworten dieser Modell-Frage-Kombination ansehen.

Leaderboard

Ranking nach Gesamt-Score (Summe aus ⌀ Score pro Disziplin, max 100). Bei gleichem Score gewinnt das kleinere Modell. Filter „baked-in ausblenden" gilt.

Lokale KI-Modelle im Test: die Ergebnisse in Kürze

Dieser LLM-Benchmark vergleicht 57 lokale KI-Modelle (0,8B bis 128B Parameter) und 77 Quantisierungs-Varianten auf 100 deutschen Business-Aufgaben — Dokumente auswerten, E-Mails schreiben, JSON liefern, Python-Code, Multi-Turn-Kontext. Jede Aufgabe läuft 10-mal, jede der über 130.000 Antworten wird von zwei unabhängigen KI-Judges bewertet (Stand 05.09.2026, Scoring v2.1, gegen 100 menschliche Urteile validiert).

Die 10 besten lokalen KI-Modelle 2026

RangModellScore /100
1Qwen 3.5-27B Thinking93,3
2Qwen 3.5-35B-A3B Thinking92,6
3Qwen 3.5-9B Thinking91,3
4Qwen 3.8-27B90,5
5Qwen 3.6-35B-A3B Thinking90,5
6Qwen 3.6-35B-A3B (NInfer)90,5
7ThinkingCap-27B90,2
8Qwen 3.5-27B90,2
9Qwen 3.6-27B Thinking89,6
10Qwen 3.8-Flash-Next88,3

Q4 vs. BF16: Was kostet Quantisierung?

Q4_K_M kostet gegenüber BF16 im Mittel 0,13 von 100 Punkten — über 14 Modellpaare mit je 1000 Testläufen. Bei einem 27B-Modell liegt die komplette Leiter von Q2 (89,4) bis BF16 (90,8) in einem 2,5-Punkte-Band. Bei kleinen Modellen kippt es: ein 3B-Modell verliert mit Q2 rund 10 Punkte. Details im Tab Quantisierung.

Häufige Fragen

Welches Modell für wenig VRAM? Qwen 3.5-9B Thinking: Platz 3 im Gesamtfeld, braucht als Q4 nur ~8 GB. Für Laptops: Gemma 4-e4B (84,2).

Ist ein größeres Modell automatisch besser? Nein — gpt-oss-120b (85,5) liegt hinter Gemma 4-31B (86,8) mit einem Viertel der Parameter. Trainingsqualität schlägt Parameterzahl.

Wie zuverlässig sind die KI-Bewertungen? Zwei unabhängige Judge-Familien (Rangkorrelation 0,996), validiert gegen 100 von Hand geprüfte Antworten: 81–82 % Übereinstimmung — das Niveau, auf dem sich auch zwei menschliche Prüfer einigen. Details im Tab Gold-Set.

Hintergründe: Der Testbericht zur Runde 2 · Wie die KI-Judges validiert wurden · Frühere Stände: 18.08.2026, 24.08.2026