OpenCompass LLM - Code (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1GPT-OSS-120B (High)72.5
2O4 Mini (2025-04-16) (High)71.7
3GPT-5 (Thinking)70.3
4O3 (2025-04-16) (High)69.6
5Qwen 3 235B A22B 2507 (Thinking)61.6
6Hunyuan-T1-2025082261.6
7GLM-4.660.9
8DeepSeek R1 052858.7
9Grok 457.2
10Seed-OSS-36B-Instruct55.8
11Gemini 2.5 Pro53.6
12Claude Sonnet 4.5 (Thinking)53.6
13Claude Haiku 4.5 (Thinking)50.7
14Qwen 3 Next 80B A3B (Thinking)49.3
15DeepSeek V3.2 Exp45.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-code-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.