Lade Benchmark-Daten
Testdaten werden vorbereitet …
winiecki.ai Potenzialcheck

Local LLM Benchmark

Testrunde 1 · Stand 18.08.2026 · 30 Fragen
Stand 18.08.2026 · 30 Fragen Stand 24.08.2026 · 100 Fragen
0 Modelle · 0 Runs · 10 Fragen · Judge:
Modus: non-thinking wo konfigurierbar · alle Modelle mit llama.cpp:server-cuda · Sampling: Author-empfohlen pro Modell
Judge:

Getestete Kategorien

10 Fragen aus verschiedenen Disziplinen. Jedes Modell beantwortet jede Frage n-mal (n aus Frage-YAML). Klick auf einen Chip springt zur Frage im „Gewinner pro Disziplin"-Block darunter.

Wie schwer war jede Disziplin?

⌀ Score aller Modelle pro Disziplin (0–10). Sortiert von schwer nach leicht. Zeigt sofort, wo die Modelle als Kohorte scheitern.

Modelle im Test

(Legende Thinking: ON = fest an, OFF = im Test aus, n/a = nicht verfügbar)
Modell Groesse (B) Quant. GGUF (GB) VRAM (GB) KV-Cache (GB) Kontext tok/s (⌀) Antwortzeit Thinking Sampling Erfolgsquote (⌀) Score /100

Gewinner pro Disziplin

Top 3 pro Frage. Basis: ⌀ Score /10 (Judge- und deterministische Bewertung). Modelle ohne Bewertung erscheinen nicht. Filter „baked-in ausblenden" gilt auch hier.
Frage Disziplin 1. Platz 2. Platz 3. Platz

Erfolgsquote pro Modell × Frage

Klick auf eine Zelle: Antworten dieser Modell-Frage-Kombination ansehen.

Leaderboard

Ranking nach Gesamt-Score (Summe aus ⌀ Score pro Disziplin, max 100). Bei gleichem Score gewinnt das kleinere Modell. Filter „baked-in ausblenden" gilt.