LiveSQLBench — leaderboard

Dynamic contamination-free text-to-SQL benchmark for real-world database tasks, including business-intelligence queries, CRUD/management SQL, hierarchical knowledge bases, and large industrial-scale database variants.

Metric: Success Rate (self-reported). Source: benchmarklist.com. Status: saturation imminent. 33 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)43.1
2Claude Opus 4.639.43
3GPT-5.5 (xHigh)37.36
4GLM-5.135.29
5GPT-5.433.56
6GPT-5.3 Codex33.33
7GPT-531.15
8O3 Mini31.15
9Claude Sonnet 4.530.46
10Kimi K2.529.89
11O329.54
12O4 Mini29.54
13Claude Sonnet 427.01
14Qwen 3 235B A22B26.9
15Claude 3.7 Sonnet (Thinking)26.55

Interactive version: theaggregate.ai/benchmark?slug=livesqlbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.