HAERAE-Vision - Coding/Development: leaderboard

Metric: Checklist Score (%; original under-specified queries, GPT-5-mini judge, mean of 3 runs). Source: arxiv.org. Saturation forecast: Around December 2026. 45 models tracked.

Top models

#ModelScore
1GPT-5 Mini57.02
2GPT-555.07
3Gemini 2.5 Pro50.91
4Qwen 3 VL 235B A22B Instruct40.1
5Gemini 2.5 Flash39.26
6Grok 439.02
7Qwen 3 VL 32B (Thinking)37.59
8Qwen 3 VL 235B A22B (Thinking)34.87
9GPT-5 Nano32.84
10Gemini 2.5 Flash Lite32.63
11Qwen 3 VL 32B Instruct32.25
12Mistral Medium 3.131.09
13Qwen 3 VL 30B A3B (Thinking)29.95
14Qwen 3 VL 30B A3B Instruct29.65
15Qwen 2.5 VL 72B Instruct25.31

Interactive version: theaggregate.ai/benchmark?slug=haerae-vision-coding-development · How It Works · Data refreshed daily, snapshot 2026-09-25.