LLMEval-Fair - History: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1DeepSeek R19.53
2DeepSeek V39.47
3Gemini 2.5 Pro (Preview)9.4
4DeepSeek V3.29.37
5Qwen 3 32B9.3
6GLM-4.69.3
7QwQ-32B9.27
8Qwen 3 235B A22B9.17
9Kimi K29.13
10GPT-59.03
11Claude Sonnet 4.5 (Thinking)9
12Gemini 2.5 Flash (Thinking)9
13O1 (2024-12-17)8.97
14Claude Sonnet 4.58.93
15Claude Sonnet 48.8

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-history · How It Works · Data refreshed daily, snapshot 2026-09-19.