DailyClue - Scientific Commonsense: leaderboard

Metric: Accuracy (%) on scientific commonsense reasoning (physics, chemistry and biology in everyday scenes) on DailyClue, 666 question-image pairs from daily scenarios whose answer requires finding a decisive visual clue; question-clue-answer triplets drafted by GPT-5 and Gemini 2.5 Pro, manually verified, and kept only when at most two of o4-mini, Gemini 2.5 Flash and Claude 3.7 Sonnet answered correctly; exact match, with a Gemini 2.5 Pro judge for open-ended answers; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro67.48
2GPT-561.79
3Gemini 2.5 Flash56.91
4Qwen 3 VL 235B A22B (Thinking)56.1
5O4 Mini50.41
6Claude Sonnet 449.59
7Qwen 3 VL 235B A22B Instruct48.78
8Claude Sonnet 4.547.97
9Claude 3.7 Sonnet47.97
10Qwen 2.5 VL 72B Instruct47.15
11InternVL3-78B42.28
12InternVL3-8B41.46
13InternVL3-38B39.84
14Qwen 2.5 VL 32B Instruct38.21
15Qwen 2.5 VL 7B Instruct34.15

Interactive version: theaggregate.ai/benchmark?slug=dailyclue-scientific-commonsense · How It Works · Data refreshed daily, snapshot 2026-10-07.