LLMEval-Fair - Management: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1GLM-4.69.63
2Gemini 2.5 Pro (Preview)9.63
3Qwen 3 32B9.47
4QwQ-32B9.46
5Qwen 3 235B A22B9.43
6DeepSeek R19.37
7DeepSeek V3.29.33
8O1 (2024-12-17)9.27
9Claude Sonnet 4.5 (Thinking)9.23
10Kimi K29.17
11DeepSeek V39.13
12GLM-4 32B9.13
13GPT-59.1
14Claude Sonnet 4.59.1
15Claude Sonnet 4 (Thinking)9.1

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-management · How It Works · Data refreshed daily, snapshot 2026-09-19.