WuYuEval - Expert Module - Judge Score: leaderboard

Metric: Mean anchor-calibrated LLM-as-a-judge score (0-1). Source: arxiv.org. 33 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B (Thinking)0.87
2Qwen 3 Max0.87
3GPT-5.20.86
4Kimi K2 (Thinking)0.86
5Qwen 3 235B A22B Instruct0.85
6Claude Opus 4.50.84
7Gemini 3 Pro (Preview)0.82
8GLM-4.6 (Non-reasoning)0.81
9Qwen 3 32B (Thinking)0.8
10Qwen 3 14B (Reasoning)0.8
11DeepSeek V3.2 (Thinking)0.8
12Qwen 3 32B (Non-reasoning)0.79
13DeepSeek V3.2 (Non-reasoning)0.78
14Qwen 3 14B (Non-reasoning)0.78
15Qwen 3 8B (Thinking)0.76

Interactive version: theaggregate.ai/benchmark?slug=wuyueval-expert-module-judge-score · How It Works · Data refreshed daily, snapshot 2026-09-19.