ClinSQL: leaderboard

Metric: Execution Score (%). Source: arxiv.org. Saturation forecast: Around December 2026. 22 models tracked.

Top models

#ModelScore
1GPT-5 Mini74.67
2Gemini 2.5 Pro73.73
3DeepSeek R1 052869.15
4GPT-5 Chat68.42
5GPT-4.167.79
6Gemini 2.5 Flash65.01
7DeepSeek V3.160.71
8O4 Mini (2025-04-16)59.22
9Qwen 3 235B A22B 2507 Instruct58.63
10Grok 4 Fast (Reasoning)58.46
11Qwen 3 Coder 480B A35B Instruct58.18
12GPT-5 Nano52.03
13Qwen 3 Next 80B A3B Instruct49.26
14Qwen 3 235B A22B 2507 FP8 (Thinking)48.54
15Llama 4 Maverick Instruct47.49

Interactive version: theaggregate.ai/benchmark?slug=clinsql · How It Works · Data refreshed daily, snapshot 2026-09-25.