BIRD-SQL — leaderboard

Database-grounded text-to-SQL benchmark over large cross-domain databases, scored primarily by whether generated SQL executes to the correct answer.

Metric: Execution Accuracy (%). Source: bird-bench.github.io. Status: saturation imminent. 55 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)72.55
2Claude Opus 4.670.15
3Claude Sonnet 4.566.85
4Command A65.68
5GLM-4.762.94
6DeepSeek R160.93
7Kimi K2 (Thinking)59.87
8GPT-454.89
9Claude 249.02

Interactive version: theaggregate.ai/benchmark?slug=bird-sql · How the rankings work · Data refreshed daily, snapshot 2026-07-22.