DiffSpot: leaderboard
Metric: Accuracy (%; (TP+TN)/4,400 over 3,900 changed pairs and 500 unchanged controls, gpt-oss-120b judge). Source: arxiv.org. Saturation forecast: Around September 2027. 13 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 3.1 Pro (Preview) | 47.2 |
| 2 | Kimi K2.5 | 42.2 |
| 3 | Gemini 3 Flash | 40.9 |
| 4 | Claude Opus 4.7 | 38.9 |
| 5 | GPT-5.4 | 38.3 |
| 6 | Qwen 3.5 397B A17B | 37.6 |
| 7 | Qwen 3 VL 235B A22B (Thinking) | 28.3 |
| 8 | GLM-4.6V-Flash | 23.8 |
| 9 | GLM-4.6V | 21.2 |
| 10 | Qwen 3 VL 30B A3B Instruct | 17.6 |
| 11 | Qwen 3 VL 30B A3B (Thinking) | 17.5 |
| 12 | Qwen 3 VL 235B A22B Instruct | 15.9 |
Interactive version: theaggregate.ai/benchmark?slug=diffspot · How It Works · Data refreshed daily, snapshot 2026-09-25.