TokenSwap-Bench (Image-Interleaved): leaderboard

Metric: Accuracy (%; 1,516 MMLU questions in which visualizable concepts (4.58 per question on average) are replaced by semantically aligned images inside the text, four-option multiple choice, standard prompt, answer letter extracted by regular expression). Source: arxiv.org. Saturation forecast: Estimated already saturated. 42 models tracked.

Top models

#ModelScore
1Claude Opus 4.692.6
2Gemini 3.1 Pro (Preview)91.4
3Claude Sonnet 4.690.6
4GPT-5.190.3
5Gemini 2.5 Pro88.8
6GPT-5.288.7
7Gemini 2.5 Flash88.5
8Gemini 3 Flash88.4
9GPT-585.6
10Claude Haiku 4.583.3
11Qwen 3 VL 8B (Thinking)80.8
12Qwen 3 VL 4B (Thinking)78
13Gemini 2.5 Flash Lite76.6
14GPT-4.176.1
15Gemini 3.1 Flash Lite75.9

Interactive version: theaggregate.ai/benchmark?slug=tokenswap-bench-image-interleaved · How It Works · Data refreshed daily, snapshot 2026-09-29.