Blog
Hier schreibe ich auf, was ich beim Betrieb lokaler KI wirklich messe: welche offenen Sprachmodelle auf eigener Hardware welche Aufgaben schaffen, wie belastbar automatische Bewertungen sind und was davon für Unternehmen mit sensiblen Daten zählt. Jeder Artikel basiert auf eigenen Testläufen, die Rohdaten stehen im Benchmark zum Nachprüfen bereit. Für Geschäftsführer, IT-Verantwortliche und alle, die KI einsetzen wollen, ohne Kundendaten aus der Hand zu geben.
🔬 Der interaktive Benchmark zu unserem großen LLM-Vergleich ist live → Zum Benchmark13. August 2026 · 7 Min. Lesezeit
Wer bewertet die Bewerter? 4 KI-Judges im Test
Vier Benchmark-Bewerter gegen ein manuelles Gold-Set getestet: Der günstigste lokale Judge ist genauer als der Cloud-Judge. Mit öffentlich dokumentiertem Bug.
Artikel lesen →29. Juli 2026 · 9 Min. Lesezeit
Lokale KI im Test: 25 Modelle, 30 Aufgaben
25 offene Sprachmodelle gegen 30 Aufgaben auf einer RTX 5090, 7.500 Testläufe, zwei unabhängige Bewerter. Was für DSGVO-konforme KI im Mittelstand reicht.
Artikel lesen →