DistortBench: leaderboard

Metric: Joint accuracy (%) on DistortBench's 13,500 four-choice questions (27 distortion types at five KADID-10k calibrated severity levels on 100 KADIS-700k photos, no reference image), the answer naming both type and severity, answered-only accuracy (unparseable responses, at most 3.4 percent, leave the denominator), chance 25; higher is better. Source: arxiv.org. Saturation forecast: Around January 2028. 18 models tracked.

Top models

#ModelScore
1Qwen 3.5 27B (Non-reasoning)61.9
2Qwen 3.5 27B58.2
3Qwen 3.5 35B A3B (Non-reasoning)56.8
4Qwen 3.5 4B (Non-reasoning)56.1
5Qwen 3.5 9B55
6Qwen 3.5 35B A3B54.6
7Qwen 3.5 4B53.1
8Qwen 3.5 9B (Non-reasoning)51.8
9GPT-5.451.6
10Gemma 3 27B47.5
11Gemma 3 12B46.6
12Qwen 2 VL 7B36.7
13Gemma 3 4B33.7

Interactive version: theaggregate.ai/benchmark?slug=distortbench · How It Works · Data refreshed daily, snapshot 2026-10-07.