WuYuEval - Expert Module - Elo: leaderboard

Metric: Elo rating from pairwise judged comparisons. Source: arxiv.org. 33 models tracked.

Top models

#ModelScore
1Claude Opus 4.52022.8
2Kimi K2 (Thinking)1954.97
3GPT-5.21904.58
4DeepSeek V3.2 (Non-reasoning)1788.91
5GLM-4.6 (Non-reasoning)1755.15
6Qwen 3 235B A22B Instruct1723.93
7Qwen 3 235B A22B (Thinking)1723.74
8Gemini 3 Pro (Preview)1719.25
9DeepSeek V3.2 (Thinking)1703.23
10Qwen 3 Max1608.84
11GPT-OSS-20B1512.59
12Gemma 3 12B (IT)1498.67
13Gemma 3 27B (IT)1458.88
14GLM-4.6 (Thinking)1423.8
15Qwen 3 32B (Thinking)1399.3

Interactive version: theaggregate.ai/benchmark?slug=wuyueval-expert-module-elo · How It Works · Data refreshed daily, snapshot 2026-09-19.