ReasonTabQA - Chinese: leaderboard

Metric: Answer Accuracy (%; LLM judge against gold answers, program-aided). Source: arxiv.org. Saturation forecast: Around December 2026. 33 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)66.96
2Claude Opus 4.5 (Thinking)65.74
3Claude Sonnet 4 (Thinking)64.35
4Kimi K263.43
5O1 Mini61.57
6Qwen 3 32B (Thinking)60.19
7GPT-4o58.8
8GPT-5.2 (Non-reasoning)58.14
9DeepSeek R156.3
10Qwen 3 32B (Non-reasoning)56.07
11Qwen 3 30B A3B (Thinking)54.77
12Qwen 3 8B (Thinking)54.63
13QwQ-32B53.11
14DeepSeek R1 Distill Qwen 32B52.78
15Qwen 2.5 72B Instruct50.75

Interactive version: theaggregate.ai/benchmark?slug=reasontabqa-chinese · How It Works · Data refreshed daily, snapshot 2026-09-25.