AIMultiple - Text-to-SQL (Strict Execution Match): leaderboard

Metric: Execution match against BIRD gold (%, over correctly routed questions). Source: aimultiple.com. 37 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)55.1
2Gemini 3.1 Pro (Preview)53.6
3Claude Fable 553.1
4GPT-652.8
5Claude Opus 552.3
6Qwen 3.6 27B47.1
7Gemini 3.5 Flash Lite46.4
8Gemini 3.1 Flash Lite45.8
9Claude Opus 4.844.5
10GPT-5.6 Sol43.8
11Grok 4.543.6
12Qwen 3.5 27B41.3
13Qwen 3.8 Max40.9
14Kimi K2.640.7
15Grok 4.340.7

Interactive version: theaggregate.ai/benchmark?slug=aimultiple-text-to-sql-strict-execution-match · How It Works · Data refreshed daily, snapshot 2026-09-19.