Human-Grounded Multimodal Benchmark with 900K — leaderboard

Metric: Science MC Accuracy (self-reported). Source: benchmarklist.com. 11 models tracked.

Top models

#ModelScore
1GPT-590.9
2Gemini 2.5 Pro72.7
3Gemini 2.5 Flash72.7
4Claude Sonnet 472.7
5Gemini 3.1 Pro (Preview)63.6
6Claude Sonnet 4.563.6
7Claude 3.7 Sonnet54.5
8Gemma 3 12B54.5
9GPT-4o45.5
10GPT-4o Mini45.5
11Qwen 2.5 VL 7B Instruct36.3

Interactive version: theaggregate.ai/benchmark?slug=human-grounded-multimodal-benchmark-with-900k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.