SuperCLUE General (September 2025) - Code Generation: leaderboard
Metric: Score. Source: www.superclueai.com. 37 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Sonnet 4.5 (Thinking) | 73.65 |
| 2 | GPT-5.1 (High) | 71.04 |
| 3 | GPT-5 (High) | 70.85 |
| 4 | Claude Opus 4.1 (Thinking) | 70.85 |
| 5 | Gemini 3 Pro (Preview) | 68.44 |
| 6 | Qwen 3 Max | 67.18 |
| 7 | GLM-4.5 | 66.41 |
| 8 | DeepSeek V3.2 Exp (Thinking) | 66.12 |
| 9 | GLM-4.6 | 65.25 |
| 10 | Grok 4 | 64.48 |
| 11 | O4 Mini (High) | 64.38 |
| 12 | Kimi K2 (Thinking) | 63.03 |
| 13 | O3 (High) | 62.16 |
| 14 | DeepSeek V3.1 Terminus (Thinking) | 61.68 |
| 15 | Kimi K2 0905 | 60.42 |
Interactive version: theaggregate.ai/benchmark?slug=superclue-general-september-2025-code-generation · How It Works · Data refreshed daily, snapshot 2026-09-19.