LLMEval-Fair - Economics: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1DeepSeek V39.57
2Gemini 2.5 Pro (Preview)9.47
3QwQ-32B9.46
4DeepSeek R19.43
5Qwen 3 235B A22B9.43
6GPT-59.37
7O1 (2024-12-17)9.3
8GLM-4.69.27
9Gemini 2.5 Flash (Thinking)9.27
10Kimi K29.17
11Claude Sonnet 4.5 (Thinking)9.17
12DeepSeek V3.29.13
13Qwen 3 32B9.1
14Claude Sonnet 4 (Thinking)9
15Claude Sonnet 4.58.97

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-economics · How It Works · Data refreshed daily, snapshot 2026-09-19.