OpenCompass Language - NLP - English (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct58.2
2Step 2 16K57.8
3Llama 3.1 405B Instruct FP854.3
4Claude 3.5 Sonnet (20240620)53.4
5Mistral Large 2 (Jul)53.4
6GPT-4o (2024-05-13)53.2
7Gemini 1.5 Pro52.5
8GLM-4 Plus50.2
9DeepSeek V2.549.8
10GPT-4o Mini (2024-07-18)49.3
11Mistral Nemo Instruct (2407)48.9
12Llama 3.1 70B Instruct48.8
13Yi Large48.8
14Gemma 2 9B (IT)48.6
15GPT-4o (2024-08-06)45.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-nlp-english-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.