SuperCLUE General (March 2026) - Science Reasoning: leaderboard

Metric: Score. Source: www.superclueai.com. 24 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Max)85.37
2GPT-5.4 (xHigh)84.15
3Gemini 3.1 Pro (Preview) (High)81.71
4Gemini 3 Flash (Preview) (High)81.71
5DeepSeek V4 Pro (Max)79.27
6DeepSeek V4 Flash (Max)79.01
7Grok 4.20 Beta (0309) (Reasoning)78.05
8Qwen 3.5 397B A17B (Thinking)75.61
9GLM-575
10MiMo-V2-Pro74.39
11GPT-OSS-120B (High)73.17
12DeepSeek V3.2 (Thinking)73.17
13Spark X271.95
14Tencent HY 2.0 Think70.73
15Qwen 3.5 122B A10B (Thinking)69.51

Interactive version: theaggregate.ai/benchmark?slug=superclue-general-march-2026-science-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.