SuperCLUE General (November 2025) - Code Generation: leaderboard

Metric: Score. Source: www.superclueai.com. 32 models tracked.

Top models

#ModelScore
1GPT-5.1 (High)76.3
2GPT-5.2 (High)73.6
3Grok 469.64
4Claude Opus 4.5 (Thinking)69.64
5Claude Sonnet 4.5 (Thinking)68.32
6Gemini 3 Pro (Preview)67.39
7Qwen 3 Max64.29
8DeepSeek V3.2 Speciale64.22
9O3 (High)63.76
10DeepSeek V3.2 Exp (Thinking)63.7
11DeepSeek V3.2 (Thinking)62.31
12Qwen 3 235B A22B 2507 (Thinking)58.94
13GLM-4.657.89
14MiniMax-M256.96
15Kimi K2 (Thinking)56.63

Interactive version: theaggregate.ai/benchmark?slug=superclue-general-november-2025-code-generation · How It Works · Data refreshed daily, snapshot 2026-09-19.