AIMultiple - Text-to-SQL (Adjudicated): leaderboard

Metric: Execution match with jury-credited equivalents and broken golds (%, over correctly routed questions). Source: aimultiple.com. 37 models tracked.

Top models

#ModelScore
1Claude Opus 582.4
2GPT-680.4
3Claude Fable 580.3
4GPT-5.6 Sol78.5
5GPT-5.577.9
6Kimi K377.2
7Claude Opus 4.876.5
8Gemini 3 Flash (Preview)75.9
9Qwen 3.8 Max75.2
10Gemini 3.1 Pro (Preview)75.1
11GPT-5.6 Terra73.8
12GPT-5.6 Luna73.7
13GLM-5.272.9
14Kimi K2.672.3
15Qwen 3.6 27B71.7

Interactive version: theaggregate.ai/benchmark?slug=aimultiple-text-to-sql-adjudicated · How It Works · Data refreshed daily, snapshot 2026-09-19.