JudgeBench Reasoning — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 52 models tracked.

Top models

#ModelScore
1Kimi K2.696.94
2Qwen 3.5 35B A3B96.94
3DeepSeek V3.2 Speciale96.94
4Gemini 3.1 Pro (Preview)96.43
5GPT-5.596.43
6Qwen 3.5 397B A17B95.92
7GPT-5 Mini95.41
8MiMo-V2-Flash95.41
9Qwen 3.6 Plus94.9
10Qwen 3.5 9B94.9
11Qwen 3.5 4B94.9
12Qwen 3.5 122B A10B94.9
13GLM-5 FP894.9
14Kimi K2.594.39
15Kimi K2 (Thinking)94.39

Interactive version: theaggregate.ai/benchmark?slug=judgebench-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.