MMTU - Table QA — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1GPT-589.48
2GPT-5 Mini87.7
3Gemini 2.5 Pro87.61
4GPT-OSS-120B85.96
5Grok 3 Mini85.9
6DeepSeek R1 052885.71
7O385.11
8Gemini 2.5 Flash84.89
9Qwen 3 235B A22B (Thinking)83.12
10GPT-OSS-20B82.83
11Qwen 3 32B82.51
12Qwen 3 8B80.76
13Llama 4 Maverick Instruct FP879.81
14Llama 4 Scout Instruct73.98
15GPT-5 Chat72.85

Interactive version: theaggregate.ai/benchmark?slug=mmtu-table-qa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.