LLMEval-Fair - Military: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview)8.87
2O1 (2024-12-17)8.77
3Qwen 3 235B A22B8.6
4GLM-4.68.57
5Gemini 2.5 Flash (Thinking)8.57
6Claude Sonnet 4.58.47
7DeepSeek R18.43
8QwQ-32B8.43
9DeepSeek V38.33
10Claude Sonnet 4.5 (Thinking)8.33
11GPT-58.3
12GPT-4o (2024-11-20)8.3
13Qwen 3 32B8.27
14Kimi K28.1
15Qwen 2.5 32B Instruct8.08

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-military · How It Works · Data refreshed daily, snapshot 2026-09-19.