DISBench (2B Retriever) - Inter-Event: leaderboard

Metric: Set-level answer F1 (%) on the 65 inter-event queries of DISBench's 122 deep image search queries over personal photo histories, ImageSeeker agent with the Qwen3-VL-Embedding-2B retriever, the model returns the set of target images; higher is better. Source: arxiv.org. Saturation forecast: Around June 2027. 10 models tracked.

Top models

#ModelScoreOverall rank
1Claude Opus 4.5 (20251101)53.4#70
2Gemini 3 Pro (Preview)40.5#64
3Claude Sonnet 4.535.4#138
4GPT-5.232.6#105
5Gemini 3 Flash (Preview)29.2#78
6GLM-4.6V27#309
7Qwen 3 VL 235B A22B Instruct24.6#264
8GPT-4o24.5#333
9Qwen 3 VL 235B A22B (Thinking)22.6#228 (Qwen 3 VL 235B A22B)
10Qwen 3 VL 32B Instruct19.6#276

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=disbench-2b-retriever-inter-event · How It Works · Data refreshed daily, snapshot 2026-10-11.