HAERAE-Vision - Natural Objects: leaderboard

Metric: Checklist Score (%; original under-specified queries, GPT-5-mini judge, mean of 3 runs). Source: arxiv.org. Saturation forecast: Around December 2026. 45 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro53.45
2GPT-553.42
3Gemini 2.5 Flash44.37
4GPT-5 Mini41.17
5Qwen 3 VL 235B A22B Instruct37.44
6Qwen 3 VL 30B A3B (Thinking)35.46
7Qwen 3 VL 32B (Thinking)35.04
8Qwen 3 VL 32B Instruct34.43
9Qwen 3 VL 235B A22B (Thinking)33.04
10Grok 430.29
11Qwen 3 VL 8B (Thinking)28.75
12Gemini 2.5 Flash Lite27.16
13Qwen 3 VL 4B (Thinking)25.31
14GPT-5 Nano25.27
15Qwen 3 VL 30B A3B Instruct25.17

Interactive version: theaggregate.ai/benchmark?slug=haerae-vision-natural-objects · How It Works · Data refreshed daily, snapshot 2026-09-25.