SciEval - Overall — leaderboard
Metric: Overall (%). Source: huggingface.co. 19 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5 | 65.59 |
| 2 | O3 | 65.38 |
| 3 | Gemini 3 Pro | 63.9 |
| 4 | Qwen 3 Max | 61.49 |
| 5 | Qwen 3 VL 235B A22B | 60.58 |
| 6 | GPT-5.1 | 57.73 |
| 7 | Gemini 2.5 Pro | 57.54 |
| 8 | Kimi K2 | 56.91 |
| 9 | Intern-S1 | 56.73 |
| 10 | Claude Sonnet 4.5 | 56.27 |
| 11 | Llama 4 Maverick | 53.74 |
| 12 | Ling-flash-2.0 | 52.49 |
| 13 | GPT-4o | 52.38 |
| 14 | Gemini 2.5 Flash | 50.85 |
| 15 | Grok 2 (1212) | 46.01 |
Interactive version: theaggregate.ai/benchmark?slug=scieval-overall · How the rankings work · Data refreshed daily, snapshot 2026-07-22.