DailyClue: leaderboard

Metric: Overall accuracy (%) on DailyClue, 666 question-image pairs from daily scenarios whose answer requires finding a decisive visual clue; question-clue-answer triplets drafted by GPT-5 and Gemini 2.5 Pro, manually verified, and kept only when at most two of o4-mini, Gemini 2.5 Flash and Claude 3.7 Sonnet answered correctly; exact match, with a Gemini 2.5 Pro judge for open-ended answers; higher is better. Source: arxiv.org. Saturation forecast: Around August 2027. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro56.9
2GPT-550.9
3Gemini 2.5 Flash50
4O4 Mini47
5Qwen 3 VL 235B A22B (Thinking)44.59
6Claude Sonnet 4.541.74
7Claude Sonnet 441.74
8Claude 3.7 Sonnet41.14
9InternVL3-78B40.84
10Qwen 2.5 VL 72B Instruct40.84
11Qwen 3 VL 235B A22B Instruct40.69
12InternVL3-38B36.94
13Qwen 2.5 VL 32B Instruct35.59
14InternVL3-8B31.08
15Qwen 2.5 VL 7B Instruct30.63

Interactive version: theaggregate.ai/benchmark?slug=dailyclue · How It Works · Data refreshed daily, snapshot 2026-10-07.