LLMEval-Fair - Engineering: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1DeepSeek R19.47
2DeepSeek V39.3
3Kimi K29.23
4Qwen 3 235B A22B9.23
5Gemini 2.5 Pro (Preview)9.2
6O1 (2024-12-17)8.9
7Claude Sonnet 4.5 (Thinking)8.9
8GPT-58.83
9Claude Sonnet 4.58.8
10GLM-4.68.8
11DeepSeek V3.28.73
12Gemini 2.5 Flash (Thinking)8.67
13Claude Sonnet 48.57
14Claude Sonnet 4 (Thinking)8.57
15Qwen 3 32B8.43

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-engineering · How It Works · Data refreshed daily, snapshot 2026-09-19.