BIRD-Python - SQL: leaderboard

Metric: LLM-validated execution accuracy (%; generated SQL executed against the corrected ('verified') 1,534 BIRD dev questions (925 simple, 464 moderate, 145 challenging), an answer counting when an LLM validator judges its result equivalent to the reference result; one generation per question). Source: arxiv.org. Saturation forecast: Around December 2026. 14 models tracked.

Top models

#ModelScore
1Qwen 3 Max63.1
2DeepSeek R162.32
3Qwen 3 32B (Thinking)61.8
4Qwen 3 Coder 30B A3B Instruct61.6
5Qwen 3 Coder Plus61.15
6Qwen 3 14B (Reasoning)58.34
7starcoder2-7B0.91

Interactive version: theaggregate.ai/benchmark?slug=bird-python-sql · How It Works · Data refreshed daily, snapshot 2026-09-29.