SciEval - Overall — leaderboard

Metric: Overall (%). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-565.59
2O365.38
3Gemini 3 Pro63.9
4Qwen 3 Max61.49
5Qwen 3 VL 235B A22B60.58
6GPT-5.157.73
7Gemini 2.5 Pro57.54
8Kimi K256.91
9Intern-S156.73
10Claude Sonnet 4.556.27
11Llama 4 Maverick53.74
12Ling-flash-2.052.49
13GPT-4o52.38
14Gemini 2.5 Flash50.85
15Grok 2 (1212)46.01

Interactive version: theaggregate.ai/benchmark?slug=scieval-overall · How the rankings work · Data refreshed daily, snapshot 2026-07-22.