HAERAE-Vision - Science: leaderboard

Metric: Checklist Score (%; original under-specified queries, GPT-5-mini judge, mean of 3 runs). Source: arxiv.org. Saturation forecast: Around August 2027. 45 models tracked.

Top models

#ModelScore
1GPT-5 Mini52.49
2Qwen 3 VL 32B (Thinking)51.94
3Qwen 3 VL 235B A22B Instruct51.51
4Qwen 3 VL 32B Instruct51.39
5Qwen 3 VL 30B A3B (Thinking)49.92
6Qwen 3 VL 235B A22B (Thinking)49.19
7Qwen 3 VL 8B (Thinking)42.07
8Gemini 2.5 Flash Lite41.73
9Grok 440.7
10Qwen 3 VL 30B A3B Instruct40.4
11Gemini 2.5 Pro39.93
12Gemini 2.5 Flash39.62
13Qwen 3 VL 4B (Thinking)38.53
14GPT-536.31
15Gemma 3 27B34.93

Interactive version: theaggregate.ai/benchmark?slug=haerae-vision-science · How It Works · Data refreshed daily, snapshot 2026-09-25.