ClaimDB: A Fact Verification Benchmark over Large Structured Data: leaderboard

Metric: Accuracy. Source: benchmarklist.com. 30 models tracked.

Top models

#ModelScore
1GPT-5 Mini0.83
2Claude Haiku 4.50.81
3Gemini 3 Flash0.8
4Gemini 2.5 Flash0.79
5GPT-5 Nano0.79
6GPT-OSS-20B0.74
7Claude 3.5 Haiku0.68
8Ministral 3 14B0.62
9Devstral Small 20.59
10Qwen 3 32B0.57
11Ministral 3 8B0.53
12Qwen 3 14B0.53
13QwQ-32B0.5
14Claude 3 Haiku0.49
15GPT-4o Mini0.45

Interactive version: theaggregate.ai/benchmark?slug=claimdb-a-fact-verification-benchmark-over-large-structured-data · How It Works · Data refreshed daily, snapshot 2026-09-19.