13. August 2026 · 7 Min. Lesezeit · Dirk Winiecki
Wer bewertet die Bewerter? 4 KI-Judges im Test
Vier Benchmark-Bewerter gegen ein manuelles Gold-Set getestet: Der günstigste lokale Judge ist genauer als der Cloud-Judge. Mit öffentlich dokumentiertem Bug.
Wer ein Benchmark aufsetzt, hat immer ein Problem: Wer bewertet die Bewertungen? Bei 12.000 Modell-Antworten manuell durchgehen ist nicht machbar — also lässt man KIs die anderen KIs bewerten. Klingt zirkulär. Ist es auch. Also haben wir vier verschiedene Judges gleichzeitig laufen lassen und geprüft, was jeder von ihnen taugt.
Das Ergebnis überrascht in zwei Punkten. Der günstigste lokale Judge ist der genaueste. Und wir haben unseren eigenen Bug öffentlich gemacht — weil das Ehrlichste ist, was man in so einer Situation machen kann.
In aller Kürze
- Vier unabhängige Judges haben dieselben ~12.000 Antworten der Testrunde 1 bewertet — GPT-5.6-luna in der Cloud, drei verschiedene Qwen-Varianten lokal.
- Menschliches Gold-Set mit 29 stratifizierten Antworten manuell bewertet, dann jeder Judge dagegen geprüft.
- Bester Judge: das kleinste lokale Modell — Qwen 27B über llama.cpp mit 93,1 % Trefferquote gegenüber der menschlichen Bewertung.
- GPT-Luna landet gleichauf mit dem schwächsten Qwen-Judge — trotz Cloud-Kosten und deutlich größerer Rechenleistung.
- Wir haben einen Bug gefunden — und dokumentiert. Ein Judge hat systematisch 341 falsche Antworten als korrekt gewertet. Nach Fix stimmt das Bild.
- Konkrete Empfehlung: Zwei lokale Qwen-Judges als Kern, GPT und MoE als Diversifikation, aber kein einzelner Judge ist der Goldstandard.
Warum überhaupt vier Judges?
Ein einzelner KI-Bewerter ist immer verdächtig. Er hat Vorlieben, Blindstellen, neigt zu bestimmten Formulierungen. Wenn Qwen 3.6 als Judge bewertet, wie gut Qwen 3.6 als Modell abschneidet, ist das kein sauberer Test — das ist Selbstlob mit strukturellem Vorteil.
Deshalb laufen vier unterschiedliche Bewerter parallel — jede Modell-Antwort wird viermal beurteilt, aus vier verschiedenen Perspektiven:
- GPT-5.6-luna von OpenAI — die externe Cloud-Referenz. Andere Familie, andere Trainingsdaten, andere Herstellerkultur.
- Qwen 3.6-27B über llama.cpp — quantisiert auf Q4_K_M, das klassische Standard-Setup für lokale Inferenz.
- Qwen 3.6-27B über NInfer — dieselben Gewichte, aber NVFP4-Quantisierung und Multi-Token-Prediction. Andere Runtime, kleinere Präzision.
- Qwen 3.6-35B-A3B (MoE) über NInfer — ein größeres Mixture-of-Experts-Modell mit einer speziellen Bewertungslogik: jeder Faktenpunkt einer Frage wird einzeln bewertet, nicht als Gesamtantwort.
Vier verschiedene Meinungen zur selben Antwort. Sind die sich einig, kann man dem Urteil vertrauen. Sind sie sich uneinig, weiß man wo man nachschauen muss.
Der Bug, den wir gefunden haben
Beim Vergleich der Judge-Verteilungen fiel etwas auf: Qwen-MoE bewertete Ja/Nein-Fragen im Schnitt mit 9,93 von 10 Punkten — die anderen drei Judges lagen zwischen 7,34 und 8,84. Das ist kein leichter Bias, das ist eine Kluft. Also nachgeschaut.
Konkretes Beispiel: Ein Modell bekommt die Frage „Wie hoch war der DAX- Schlusskurs am vergangenen Freitag?" Das Modell antwortet mit einer konkreten Zahl (was nicht sein soll — das Modell sollte klarstellen, dass es keine Echtzeitdaten hat). Drei Judges bewerten das korrekt als „durchgefallen". Qwen-MoE bewertet es als „bestanden". Bei etlichen weiteren Antworten dasselbe Muster.
Ursache: In der Judge-Antwort stand das Feld "erfuellt" als Zeichenkette "False" statt als Boolean-Wert false. Der Aggregations-Code prüfte mit einem einfachen Wahrheitscheck — und eine nicht-leere Zeichenkette gilt in Python als wahr. Ergebnis: die als „False" markierten Ablehnungen wurden als Zustimmungen gezählt. Klassisches Programmierproblem an einem unerwarteten Ort.
Der String-Bool-Bug in Zahlen
Vor dem Fix
9.93 / 10
Qwen-MoE Ja/Nein-Aufgaben — künstlich zu mild
Nach dem Fix
7.09 / 10
Konsistent mit GPT-Luna (7.34) und Qwen-Q4 (8.40)
341 von 1200 Ja/Nein-Bewertungen des MoE-Judges wurden fälschlich als „bestanden" gewertet. Grund: das Modell schrieb "False" als Zeichenkette statt als Boolean — der Aggregations-Code interpretierte den nicht-leeren String als wahr. Rohantworten unverändert, nur die abgeleiteten Score-Felder wurden neu berechnet.
Warum fällt das nur einem Judge auf die Füße? Weil GPT-Luna und Qwen-Q4 auf llama.cpp einen strengen Schema-Modus nutzen (die Antwort MUSS ein Boolean sein, sonst gibt der Server einen Fehler zurück). NInfer, die neuere Runtime für die zwei anderen Qwen-Judges, prüft die Feldtypen nicht genauso strikt — das größere MoE-Modell fiel besonders oft in die Falle.
Nach dem Fix passt der Wert: statt 9,93 jetzt 7,09. Näher an der Realität, näher am Konsens der anderen drei Judges.
Die Gold-Set-Prüfung
Der eigentliche Test kam danach. 30 Antworten aus dem Datensatz stratifiziert gesampelt — eine pro Kategorie-Variante — und dann Zeile für Zeile manuell bewertet. Frage lesen, Antwort lesen, gemäß der Bewertungsrubrik entscheiden. Dann jeder Judge gegen diese menschliche Bewertung verglichen.
Übereinstimmung mit menschlicher Bewertung (29 Gold-Set-Fragen)
Basis: 29 stratifizierte Antworten aus 30 Kategorie-Varianten der Testrunde 1, jeweils manuell nach der Judge-Rubrik bewertet und mit den vier Judge-Urteilen abgeglichen.
Das ist ein bemerkenswertes Ergebnis. Der günstigste Judge — Qwen 3.6-27B quantisiert auf Q4_K_M, läuft auf jedem halbwegs modernen PC mit ausreichend VRAM — trifft am häufigsten die richtige Bewertung. GPT-Luna, die Cloud-Referenz, landet gleichauf mit dem schwächsten der lokalen Judges.
Interessant sind die Streit-Fälle. In einer Antwort zu einem CRM-Setup nannte das Modell fälschlich „25 Personen" statt der im Prompt angegebenen 5. Das ist ein klarer Faktenfehler. Die zwei Qwen-Judges (Q4 und MTP) fanden ihn. GPT-Luna und der MoE-Judge übersahen ihn und werteten die Antwort als korrekt. Bei einer erfundenen PostgreSQL-Konfiguration ähnlich — Qwen-MoE akzeptierte, was drei andere Judges als Halluzination entlarvten.
Was wir daraus lernen
Ein einzelner Judge — auch ein teurer, auch ein Cloud-basierter — ist nicht der Goldstandard. GPT-Luna ist nicht besser als lokale Alternativen, nur weil er teurer ist und in der Cloud läuft. Das ist ein Ergebnis, das die üblichen Marketing-Erwartungen umkehrt.
Diversität ist wichtiger als „das eine beste Modell". Die Qwen-Judges finden Faktenfehler, die GPT übersieht. GPT bringt eine andere Perspektive ein, weil es aus einer anderen Modellfamilie kommt. MoE ist am besten bei Faktenabgleich-Aufgaben, wo jeder Punkt einer Checkliste einzeln geprüft wird. Zusammen ergeben sie ein Bild, das keiner alleine liefern könnte.
Bugs findet man nur, wenn man sucht. Der String-Bool-Bug wäre in einer Single-Judge-Auswertung nie aufgefallen. Er fiel nur auf, weil vier Judges nebeneinander liefen und einer systematisch aus der Reihe tanzte. Das ist einer der wichtigsten Gründe, warum ein Benchmark mehrere Bewerter braucht — nicht für den Score, sondern für die Qualitätskontrolle.
Was das für dich heißt
Wenn du selbst KI-Antworten bewerten willst — für ein internes System, für einen internen Test, für ein Kunden-Feedback-System — dann nutze nicht nur einen Judge. Zwei reicht bei einfachen Aufgaben, drei ist die stabile Untergrenze, wenn es um Fakten geht. Und ein Judge sollte lokal laufen, unabhängig von Cloud-Anbietern.
Kosten spielen dabei eine Rolle, aber nicht die, die man erwarten würde. Die lokalen Judges kosten in Testrunde 1 nichts pro Bewertung — die Hardware steht ohnehin da. GPT-Luna hat für die 3.000 Bewertungen etwa fünf Euro gekostet. Das ist nicht viel, aber es ist auch nicht das Geld, das den Unterschied macht.
Der Unterschied entsteht durch Diversität und Nachvollziehbarkeit.Jede Bewertung wird gespeichert, jede Belegstelle nachvollziehbar. Wenn ein Judge unerklärlich anders bewertet als die anderen drei, sieht man das sofort — und kann nachschauen, warum. Bei einer Ein-Judge-Auswertung fällt genau dieser Sanity-Check weg.
Nachlesen und selber prüfen
Die vollständigen Zahlen — Match-Raten pro Judge-Typ, alle Divergenzen, die Bug-Fix-Statistiken — stehen als methodischer Anhang direkt beim Datensatz: im Benchmark-Viewer unter „Judge-Analyse". Wer den Ergebnissen misstraut, kann jede einzelne Bewertung mit Belegstelle einsehen und selbst nachprüfen.
Die Ergebnisse, die diese Judges bewertet haben, stehen im Artikel Lokale KI im Test: 25 Modelle, 30 Aufgaben.
Der nächste Test ist Testrunde 2 mit 100 statt 30 Fragen und einer erweiterten Thinking-Auswertung. Der aktuelle 4-Judge-Setup läuft dort genauso — aber mit dem Wissen aus dieser Validierung im Rücken.
Testrunde 1 · Judge-Validierung · winiecki.ai · Dirk Winiecki
Wer bewertet die Bewerter? Wir schauen genau hin und dokumentieren was wir finden.
Lokale KI für dein Unternehmen prüfen
Ehrliche Einschätzung, ob und wie lokale KI in deinem Setup Sinn ergibt. 30 Minuten, kostenlos, unverbindlich.
Potenzialcheck buchen