DISBench (2B Retriever) - Intra-Event: leaderboard

Metric: Set-level answer F1 (%) on the 57 intra-event queries of DISBench's 122 deep image search queries over personal photo histories, ImageSeeker agent with the Qwen3-VL-Embedding-2B retriever, the model returns the set of target images; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 10 models tracked.

Top models

#ModelScoreOverall rank
1Claude Opus 4.5 (20251101)57.9#70
2Gemini 3 Pro (Preview)56.3#64
3Claude Sonnet 4.544#138
4Gemini 3 Flash (Preview)39.3#78
5GPT-5.238#105
6GLM-4.6V34.2#309
7Qwen 3 VL 32B Instruct32#276
8Qwen 3 VL 235B A22B Instruct26.1#264
9Qwen 3 VL 235B A22B (Thinking)23.2#228 (Qwen 3 VL 235B A22B)
10GPT-4o19.6#333

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=disbench-2b-retriever-intra-event · How It Works · Data refreshed daily, snapshot 2026-10-11.