LLMEval-Fair - Overall: leaderboard

Metric: Absolute Score (0-100). Source: github.com. 59 models tracked.

Top models

#ModelScore
1DeepSeek R191.23
2Gemini 2.5 Pro (Preview)91.07
3DeepSeek V390.37
4Qwen 3 235B A22B90.33
5GLM-4.689.23
6QwQ-32B88.54
7Kimi K288.3
8GPT-587.9
9Claude Sonnet 4.5 (Thinking)87.57
10O1 (2024-12-17)87.43
11Claude Sonnet 4.587.4
12Gemini 2.5 Flash (Thinking)86.87
13DeepSeek V3.286.43
14Qwen 3 32B86.37
15Claude Sonnet 4 (Thinking)85.27

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.