LLMEval-Fair - Literature: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1DeepSeek R18.83
2DeepSeek V38.6
3Gemini 2.5 Pro (Preview)8.43
4Kimi K28.4
5GLM-4.68.4
6Claude Sonnet 4.58.37
7Qwen 3 235B A22B8.23
8GPT-58.1
9Claude Sonnet 4.5 (Thinking)8
10QwQ-32B7.83
11Claude Sonnet 47.8
12Gemini 2.5 Flash (Thinking)7.8
13Qwen 3 32B7.77
14GPT-4o Search Preview7.77
15O1 (2024-12-17)7.73

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-literature · How It Works · Data refreshed daily, snapshot 2026-09-19.