Spider 2.0: leaderboard

Enterprise text-to-SQL workflow benchmark over BigQuery, Snowflake, DBT, and realistic database engineering tasks.

Metric: Accuracy (%). Source: spider2-sql.github.io. Status: saturation imminent. 37 models tracked.

Top models

#ModelScore
1GLM-5.276.23
2Claude Opus 4.565.81
3O355.21
4GPT-554.66
5O4 Mini53.02
6DeepSeek R152.28
7DeepSeek V4 Flash42.4
8Claude Sonnet 4.541.86
9GLM-532.36
10O1 Preview30.35
11Claude 3.7 Sonnet (20250219) (Thinking)28.52
12Claude Sonnet 4 (20250514)27.79
13DeepSeek V326.14
14Claude 3.7 Sonnet (20250219)25.41
15O3 Mini (2025-01-31)23.4

Interactive version: theaggregate.ai/benchmark?slug=spider-2-0 · How It Works · Data refreshed daily, snapshot 2026-09-05.