OpenCompass Language - Dialogue — leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 26 models tracked.

Top models

#ModelScore
1Qwen 3 Max (2026-01-23)98.9
2Claude Sonnet 4.5 (Thinking)98.8
3Kimi K2.598.6
4Kimi K2 (Thinking)98.5
5Qwen 3 235B A22B (Thinking)98.1
6Claude Opus 4.5 (Thinking)98.1
7GPT-OSS-120B (High)98
8Ring-1T98
9MiniMax-M2.197
10Ling-1T96.3
11Grok 4.196.2
12O3 (2025-04-16) (High)96.1
13Qwen 3 Next 80B A3B (Thinking)95.5
14Seed-OSS-36B-Instruct94.4
15ERNIE 5.094.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-dialogue · How the rankings work · Data refreshed daily, snapshot 2026-07-22.