Mr.LHDR - Web Search VLMs - Strict Answer-and-Process Accuracy: leaderboard

Metric: SA (%; Qwen3-VL-235B judge, 102 items). Source: arxiv.org. 11 models tracked.

Top models

#ModelScore
1GPT-5.534.3
2Claude Opus 4.727.5
3GPT-5.422.5
4O4 Mini20.6
5Grok 4.2017.6
6Claude Sonnet 4.615.7
7O315.7
8GPT-4.113.7
9GPT-4o (2024-11-20)12.7
10GPT-5.4 Mini4.9
11GPT-4o Mini (2024-07-18)3.9

Interactive version: theaggregate.ai/benchmark?slug=mr-lhdr-web-search-vlms-strict-answer-and-process-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-19.