UniQL - All-Dialect Consistency: leaderboard

Metric: Share of the 1,534 UniQL questions (%) answered correctly (execution match) in all 16 SQL dialects; inference-only, one run; higher is better. Source: arxiv.org. Saturation forecast: Around 2032. 13 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.520.14
2GPT-5 Mini17.99
3Qwen 3 32B14.41
4GPT-5.1 Codex14.34
5Llama 3 70B Instruct14.08
6DeepSeek V4 Flash13.89
7Qwen 3 8B12.06
8Gemini 2.5 Pro9.19
9GPT-3.5 Turbo9.13
10Qwen 3 4B8.8
11Qwen 3 1.7B5.8
12Llama 3 8B Instruct2.54

Interactive version: theaggregate.ai/benchmark?slug=uniql-all-dialect-consistency · How It Works · Data refreshed daily, snapshot 2026-09-29.