WuYuEval - Foundation Module - Accuracy: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 33 models tracked.

Top models

#ModelScore
1Claude Opus 4.594.64
2Gemini 3 Pro (Preview)92.77
3GLM-4.6 (Non-reasoning)92.31
4DeepSeek V3.2 (Thinking)92.16
5Qwen 3 Max91.83
6DeepSeek V3.2 (Non-reasoning)91.37
7Kimi K2 (Thinking)91.26
8Qwen 3 235B A22B (Thinking)90.83
9GPT-5.290.04
10Qwen 3 235B A22B Instruct89.63
11Qwen 3 32B (Thinking)87.86
12Qwen 3 32B (Non-reasoning)87.49
13GLM-4.6 (Thinking)84.97
14Gemma 3 27B (IT)82.29
15Qwen 3 14B (Reasoning)81.37

Interactive version: theaggregate.ai/benchmark?slug=wuyueval-foundation-module-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-19.