WuYuEval - Expert Module - Judge Score: leaderboard
Metric: Mean anchor-calibrated LLM-as-a-judge score (0-1). Source: arxiv.org. 33 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen 3 235B A22B (Thinking) | 0.87 |
| 2 | Qwen 3 Max | 0.87 |
| 3 | GPT-5.2 | 0.86 |
| 4 | Kimi K2 (Thinking) | 0.86 |
| 5 | Qwen 3 235B A22B Instruct | 0.85 |
| 6 | Claude Opus 4.5 | 0.84 |
| 7 | Gemini 3 Pro (Preview) | 0.82 |
| 8 | GLM-4.6 (Non-reasoning) | 0.81 |
| 9 | Qwen 3 32B (Thinking) | 0.8 |
| 10 | Qwen 3 14B (Reasoning) | 0.8 |
| 11 | DeepSeek V3.2 (Thinking) | 0.8 |
| 12 | Qwen 3 32B (Non-reasoning) | 0.79 |
| 13 | DeepSeek V3.2 (Non-reasoning) | 0.78 |
| 14 | Qwen 3 14B (Non-reasoning) | 0.78 |
| 15 | Qwen 3 8B (Thinking) | 0.76 |
Interactive version: theaggregate.ai/benchmark?slug=wuyueval-expert-module-judge-score · How It Works · Data refreshed daily, snapshot 2026-09-19.