OpenCompass Agent - Tool Use (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1GLM-4.673.6
2Nanbeige3.5-Pro (Thinking)72.1
3Claude Sonnet 4.5 (Thinking)71.4
4Qwen 3 235B A22B 2507 (Thinking)70.4
5Claude Haiku 4.5 (Thinking)70.4
6Hunyuan-T1-2025082266.8
7Qwen 3 Next 80B A3B (Thinking)66.3
8Kimi K2 090566.1
9DeepSeek V3.2 Exp61.8
10DeepSeek R1 052861.3
11GPT-5 (Thinking)57.2
12Ling-1T54.9
13Grok 454.8
14MiniMax-M254.3
15Gemini 2.5 Pro52.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-agent-tool-use-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.