SGI-Bench Experimental Reasoning — leaderboard

Metric: Experimental Reasoning Score. Source: github.com. 19 models tracked.

Top models

#ModelScore
1Gemini 3 Pro41.92
2Gemini 2.5 Pro41.24
3GPT-5.2 Pro39.18
4Claude Opus 4.138.83
5GPT-4.138.49
6GPT-538.14
7Claude Sonnet 4.537.8
8Qwen 3 Max37.8
9Gemini 2.5 Flash34.36
10GPT-5.134.02
11O4 Mini33.33
12O332.65
13GPT-4o32.3
14Qwen 3 VL 235B A22B31.62
15Grok 430.24

Interactive version: theaggregate.ai/benchmark?slug=sgi-bench-experimental-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.