Local LLM Benchmark

Testrunde 1 winiecki.ai →
0 Modelle · 0 Runs · 10 Fragen · Judge:
Modus: non-thinking wo konfigurierbar · alle Modelle mit llama.cpp:server-cuda · Sampling: Author-empfohlen pro Modell
Judge:

Getestete Kategorien

10 Fragen aus verschiedenen Disziplinen. Jedes Modell beantwortet jede Frage n-mal (n aus Frage-YAML). Klick auf einen Chip springt zur Frage im „Gewinner pro Disziplin"-Block darunter.

Modelle im Test

(Legende: disabled n/a baked-in)
Modell Groesse (B) Quant. GGUF (GB) VRAM (GB) KV-Cache (GB) tok/s (⌀) Thinking Sampling Erfolgsquote (⌀) Score /100

Gewinner pro Disziplin

Top 3 pro Frage. Basis: ⌀ Score /10 (Judge- und deterministische Bewertung). Modelle ohne Bewertung erscheinen nicht. Filter „baked-in ausblenden" gilt auch hier.
Frage Disziplin 1. Platz 2. Platz 3. Platz

Erfolgsquote pro Modell × Frage

Klick auf eine Zelle: Antworten dieser Modell-Frage-Kombination ansehen.

Leaderboard

Ranking nach Gesamt-Score (Summe aus ⌀ Score pro Disziplin, max 100). Bei gleichem Score gewinnt das kleinere Modell. Filter „baked-in ausblenden" gilt.