Getestete Kategorien
10 Fragen aus verschiedenen Disziplinen. Jedes Modell beantwortet jede Frage n-mal (n aus Frage-YAML).
Klick auf einen Chip springt zur Frage im „Gewinner pro Disziplin"-Block darunter.
Wie schwer war jede Disziplin?
⌀ Score aller Modelle pro Disziplin (0–10). Sortiert von schwer nach leicht.
Zeigt sofort, wo die Modelle als Kohorte scheitern.
Modelle im Test
(Legende Thinking:
ON = fest an,
OFF = im Test aus,
n/a = nicht verfügbar)
| Modell | Groesse (B) | Quant. | GGUF (GB) | VRAM (GB) | KV-Cache (GB) | Kontext | tok/s (⌀) | Antwortzeit | Thinking | Sampling | Erfolgsquote (⌀) | Score /100 |
|---|
Gewinner pro Disziplin
Top 3 pro Frage. Basis: ⌀ Score /10 (Judge- und deterministische Bewertung).
Modelle ohne Bewertung erscheinen nicht. Filter „baked-in ausblenden" gilt auch hier.
| Frage | Disziplin | 1. Platz | 2. Platz | 3. Platz |
|---|
Erfolgsquote pro Modell × Frage
Klick auf eine Zelle: Antworten dieser Modell-Frage-Kombination ansehen.
Speed vs. Score — welches Modell für welche Anforderung
Jeder Punkt ist ein Modell. X-Achse: Generierungsgeschwindigkeit in Tokens/Sekunde. Y-Achse: Score /100 (Qwen-Q4-Judge). Punktgröße = VRAM-Verbrauch. Farbe = Runtime. Die orange Pareto-Frontier verbindet die Modelle, die für ihren Speed keinen besseren Score-Wettbewerber haben — alles unter dieser Linie ist strikt dominiert.
Lade Judge-Analyse …
Lade Methodik …
Leaderboard
Ranking nach Gesamt-Score (Summe aus ⌀ Score pro Disziplin, max 100).
Bei gleichem Score gewinnt das kleinere Modell. Filter „baked-in ausblenden" gilt.