ReasonTabQA: leaderboard

Metric: Answer Accuracy (%; LLM judge against gold answers, program-aided). Source: arxiv.org. Saturation forecast: Around December 2026. 33 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)67.58
2Claude Opus 4.5 (Thinking)66.2
3Claude Sonnet 4 (Thinking)62.53
4Kimi K259.57
5GPT-5.2 (Non-reasoning)59.46
6Qwen 3 32B (Thinking)58.76
7GPT-4o56.9
8DeepSeek R155.8
9O1 Mini55.8
10QwQ-32B54.1
11DeepSeek R1 Distill Qwen 32B53.64
12Qwen 3 30B A3B (Thinking)53.61
13Qwen 3 32B (Non-reasoning)53.13
14DeepSeek V352.15
15Qwen 2.5 72B Instruct51.92

Interactive version: theaggregate.ai/benchmark?slug=reasontabqa · How It Works · Data refreshed daily, snapshot 2026-09-25.