ReasonTabQA - English: leaderboard

Metric: Answer Accuracy (%; LLM judge against gold answers, program-aided). Source: arxiv.org. Saturation forecast: Around December 2026. 33 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)68.44
2Claude Opus 4.5 (Thinking)66.84
3GPT-5.2 (Non-reasoning)61.29
4Claude Sonnet 4 (Thinking)60
5Qwen 3 32B (Thinking)56.77
6QwQ-32B55.48
7DeepSeek R155.11
8DeepSeek R1 Distill Qwen 32B54.84
9DeepSeek V354.81
10GPT-4o54.25
11Kimi K254.19
12Qwen 2.5 72B Instruct53.55
13Qwen 3 30B A3B (Thinking)52
14Qwen 3 32B (Non-reasoning)49.03
15O1 Mini47.74

Interactive version: theaggregate.ai/benchmark?slug=reasontabqa-english · How It Works · Data refreshed daily, snapshot 2026-09-25.