DataBench: leaderboard

Real-world tabular question-answering benchmark over many datasets, used in SemEval 2025 Task 8.

Metric: Score (%). Source: hex.tech. Status: years away from saturation. 32 models tracked.

Top models

#ModelScore
1Claude Opus 5 (High)88
2Claude Fable 5 (Max)85
3Claude Opus 5 (Medium)83
4Claude Opus 5 (xHigh)80
5Claude Fable 5 (Medium)76
6GPT-5.6 Sol (xHigh)75
7Claude Opus 4.8 (Max)74
8GPT-5.6 Luna (xHigh)73
9GPT-5.6 Sol (High)72
10Claude Fable 5 (Low)72
11Claude Opus 4.8 (Low)72
12GPT-5.6 Sol (Medium)71
13Claude Fable 5 (High)71
14Claude Opus 5 (Max)70
15Claude Opus 4.8 (High)70

Interactive version: theaggregate.ai/benchmark?slug=databench · How It Works · Data refreshed daily, snapshot 2026-09-05.