LiveSQLBench: leaderboard

Dynamic contamination-free text-to-SQL benchmark for real-world database tasks, including business-intelligence queries, CRUD/management SQL, hierarchical knowledge bases, and large industrial-scale database variants.

Metric: Success Rate (self-reported). Source: benchmarklist.com. Status: saturation imminent. 33 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)43.1
2Claude Opus 4.639.43
3GPT-5.5 (xHigh)37.36
4Kimi K2.636.43
5GLM-5.135.29
6Qwen 3.6 Max33.79
7GPT-5.433.56
8GPT-5.3 Codex33.33
9GPT-531.15
10O3 Mini31.15
11Claude Sonnet 4.530.46
12Kimi K2.529.89
13O329.54
14O4 Mini29.54
15Claude Sonnet 427.01

Interactive version: theaggregate.ai/benchmark?slug=livesqlbench · How It Works · Data refreshed daily, snapshot 2026-09-05.