BenCzechMark - Reading Comprehension: leaderboard

Metric: Duel Win Score (%). Source: huggingface.co. 78 models tracked.

Top models

#ModelScore
1Qwen 3.6 27B87.88
2Llama 3.1 405B Instruct85.28
3Qwen 2.5 72B80.95
4c4ai-command-a-03-202577.92
5MiniMax M1 80k75.32
6DeepSeek V3 (0324)74.46
7Llama 4 Scout Instruct73.59
8DeepSeek R1 052871.86
9Gemma 4 31B (IT)71.43
10Mistral Large 2 (Nov) Instruct (2411)71.43
11Llama 4 Maverick Instruct71
12Llama 3.1 70B69.7
13DeepSeek V4 Flash (0731)68.83
14Gemma 4 26B A4B (IT)68.4
15Llama 3.3 70B Instruct64.5

Interactive version: theaggregate.ai/benchmark?slug=benczechmark-reading-comprehension · How It Works · Data refreshed daily, snapshot 2026-09-19.