OpenCompass LLM - Agent (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (Thinking)67.2
2GLM-4.666.7
3Claude Haiku 4.5 (Thinking)63.4
4Kimi K2 090562.5
5DeepSeek R1 052862.3
6GPT-5 (Thinking)59.6
7O4 Mini (2025-04-16) (High)59.4
8Qwen 3 Next 80B A3B (Thinking)59.2
9Qwen 3 235B A22B 2507 (Thinking)58.4
10Nanbeige3.5-Pro (Thinking)58.1
11O3 (2025-04-16) (High)57.4
12Gemini 2.5 Pro57.3
13DeepSeek V3.2 Exp56.8
14MiniMax-M256.2
15Hunyuan-T1-2025082252.4

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-agent-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.