HAERAE-Vision - Mathematics: leaderboard

Metric: Checklist Score (%; original under-specified queries, GPT-5-mini judge, mean of 3 runs). Source: arxiv.org. Saturation forecast: Around December 2026. 45 models tracked.

Top models

#ModelScore
1Qwen 3 VL 30B A3B (Thinking)68.69
2Qwen 3 VL 32B (Thinking)64.57
3Gemini 2.5 Pro60.94
4Qwen 3 VL 32B Instruct60.92
5GPT-5 Mini58.19
6Qwen 3 VL 235B A22B (Thinking)56.51
7GPT-554.7
8Qwen 3 VL 235B A22B Instruct54.31
9Qwen 3 VL 30B A3B Instruct51.38
10Gemini 2.5 Flash51.14
11Qwen 3 VL 8B (Thinking)47.83
12Qwen 3 VL 4B (Thinking)46.69
13Gemini 2.5 Flash Lite45.62
14Mistral Medium 3.138.99
15Qwen 3 VL 8B Instruct35.94

Interactive version: theaggregate.ai/benchmark?slug=haerae-vision-mathematics · How It Works · Data refreshed daily, snapshot 2026-09-25.