Tinybird AI SQL Benchmark - Exactness: leaderboard

Metric: Result exactness vs human reference queries (0-100). Source: llm-benchmark.tinybird.live. 327 models tracked.

Top models

#ModelScore
1Claude Opus 4.765.48
2Claude Fable 565.05
3Claude Fable 5.161.53
4Gemini 3 Pro (Preview)60.3
5Qwen 3.5 Plus60.17
6Gemini 3.5 Flash60.05
7Grok 4.659.71
8Gemini 3.6 Flash59.48
9Gemini 2.5 Pro (Preview 05-06)58.94
10Gemini 3 Flash (Preview)58.35
11Gemini 2.5 Pro57.98
12Claude Opus 4.857.77
13GLM-5.3 Flash57.62
14Seed 2.0 Lite57.35
15Muse Spark 1.257.22

Interactive version: theaggregate.ai/benchmark?slug=tinybird-ai-sql-benchmark-exactness · How It Works · Data refreshed daily, snapshot 2026-09-19.