LLMEval-Fair - Science: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview)9.07
2DeepSeek R19.03
3Claude Sonnet 4.58.97
4DeepSeek V38.97
5Qwen 3 235B A22B8.97
6Claude Sonnet 4 (Thinking)8.93
7GPT-58.9
8O1 (2024-12-17)8.9
9Claude Sonnet 4.5 (Thinking)8.9
10GLM-4.68.9
11Gemini 2.5 Flash (Thinking)8.9
12DeepSeek V3.28.87
13Claude Sonnet 48.8
14Kimi K28.77
15Qwen 3 32B8.67

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-science · How It Works · Data refreshed daily, snapshot 2026-09-19.