WuYuEval - Foundation Module - Macro-F1: leaderboard

Metric: Macro-F1 (%). Source: arxiv.org. 33 models tracked.

Top models

#ModelScore
1Claude Opus 4.595.73
2Gemini 3 Pro (Preview)95.53
3GLM-4.6 (Non-reasoning)93.54
4DeepSeek V3.2 (Thinking)93.51
5Qwen 3 Max93.09
6DeepSeek V3.2 (Non-reasoning)92.66
7Qwen 3 235B A22B (Thinking)92.54
8Kimi K2 (Thinking)92.23
9GPT-5.291.36
10Qwen 3 235B A22B Instruct90.93
11Qwen 3 32B (Thinking)89.58
12Qwen 3 32B (Non-reasoning)89.18
13Qwen 3 14B (Reasoning)87.7
14GLM-4.6 (Thinking)86.53
15Gemma 3 27B (IT)84.73

Interactive version: theaggregate.ai/benchmark?slug=wuyueval-foundation-module-macro-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.