DiCoBench - Entity Difference: leaderboard

Metric: Accuracy (%) on the entity-difference task (a small object added, removed or replaced) of DiCoBench (765 multi-image samples at near-2K resolution): 5-option multiple choice (four candidate image pairs or instructions plus a no-visible-difference option, chance 20%), answer letter matched exactly, VLMEvalKit settings at temperature 0; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 18 models tracked.

Top models

#ModelScore
1Gemini 3 Pro89.5
2GPT-4.1 Mini55.8
3Gemini 3 Flash55.6
4GPT-554.7
5Qwen 2.5 VL 7B Instruct53.7
6O4 Mini53.7
7GPT-4o46.3
8Qwen 3.5 35B A3B42.1
9Qwen 2.5 VL 32B Instruct35.8
10Gemma 3 12B (IT)34.7
11Gemma 3 27B (IT)30.5
12GPT-4.130.5

Interactive version: theaggregate.ai/benchmark?slug=dicobench-entity-difference · How It Works · Data refreshed daily, snapshot 2026-09-29.