OpenCompass Language - Dialogue - English (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1GLM-4 Plus61.8
2Step 2 16K58.5
3DeepSeek V2.554.5
4GPT-4o (2024-05-13)49.5
5GPT-4o Mini (2024-07-18)48.9
6GLM-4 9B Chat48.6
7Yi-1.5-9B Chat47.7
8Mistral Nemo Instruct (2407)47.7
9Llama 3.1 70B Instruct47.3
10Qwen 2.5 72B Instruct47
11Yi Large46.6
12Llama 3.1 405B Instruct FP845.9
13GPT-4o (2024-08-06)43.6
14Mistral-Small-Instruct-240942.3
15Mistral Large 2 (Jul)41.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-dialogue-english-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.