HAERAE-Vision - Machinery: leaderboard

Metric: Checklist Score (%; original under-specified queries, GPT-5-mini judge, mean of 3 runs). Source: arxiv.org. Saturation forecast: Around December 2026. 45 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro56.22
2GPT-552.85
3GPT-5 Mini51.68
4Grok 447.63
5Qwen 3 VL 235B A22B Instruct47.42
6Gemini 2.5 Flash45.86
7Qwen 3 VL 32B Instruct41.73
8Qwen 3 VL 30B A3B (Thinking)38.48
9Qwen 3 VL 235B A22B (Thinking)38.37
10Gemini 2.5 Flash Lite38.3
11Qwen 3 VL 32B (Thinking)35.66
12Qwen 3 VL 30B A3B Instruct34.18
13Mistral Medium 3.134.14
14Qwen 3 VL 8B (Thinking)29.73
15Qwen 3 VL 4B (Thinking)29.72

Interactive version: theaggregate.ai/benchmark?slug=haerae-vision-machinery · How It Works · Data refreshed daily, snapshot 2026-09-25.