SuperCLUE General (September 2025) - Science Reasoning: leaderboard

Metric: Score. Source: www.superclueai.com. 37 models tracked.

Top models

#ModelScore
1Kimi K2 (Thinking)54.31
2O4 Mini (High)54.31
3Gemini 3 Pro (Preview)53.45
4GPT-5.1 (High)53.45
5Doubao-Seed-1.6-thinking-25071552.59
6GPT-OSS-120B50.86
7Gemini 2.5 Pro50
8Qwen 3 Max48.28
9DeepSeek V3.1 Terminus (Thinking)47.41
10Qwen 3 235B A22B 2507 (Thinking)46.55
11DeepSeek V3.2 Exp (Thinking)45.69
12Claude Opus 4.1 (Thinking)45.69
13GPT-5 (High)44.83
14GLM-4.643.97
15GLM-4.543.1

Interactive version: theaggregate.ai/benchmark?slug=superclue-general-september-2025-science-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.