HAERAE-Vision: leaderboard

Metric: Checklist Score (%; original under-specified queries, GPT-5-mini judge, mean of 3 runs). Source: arxiv.org. Saturation forecast: Around December 2026. 45 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro48.54
2GPT-548.01
3GPT-5 Mini45.21
4Gemini 2.5 Flash41.05
5Qwen 3 VL 235B A22B Instruct38.41
6Grok 436.08
7Qwen 3 VL 32B Instruct36.08
8Qwen 3 VL 32B (Thinking)35.49
9Qwen 3 VL 235B A22B (Thinking)35.47
10Qwen 3 VL 30B A3B (Thinking)35.41
11Qwen 3 VL 30B A3B Instruct30.92
12Gemini 2.5 Flash Lite30.29
13Qwen 3 VL 8B (Thinking)28.01
14Qwen 3 VL 4B (Thinking)26.18
15Mistral Medium 3.124.86

Interactive version: theaggregate.ai/benchmark?slug=haerae-vision · How It Works · Data refreshed daily, snapshot 2026-09-25.