OpenCompass LLM - Math (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct77
2Mistral Large 2 (Jul)73.7
3Claude 3.5 Sonnet (20240620)72.1
4GPT-4o (2024-05-13)70.6
5GPT-4o (2024-08-06)70.5
6Llama 3.1 405B Instruct FP870.1
7GLM-4 Plus67.6
8Qwen 2.5 7B Instruct66.9
9DeepSeek V2.566.5
10Step 2 16K62.1
11Gemini 1.5 Pro61.3
12Llama 3.1 70B Instruct58.7
13Yi Large55.5
14GPT-4o Mini (2024-07-18)54.5
15Mistral-Small-Instruct-240951.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-math-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.