MemeBench - Visual Clues: leaderboard

Metric: Visual-clue coverage (%) on 1,253 Chinese and English memes centred on anime, comics, games and online subcultures, explained closed-book from the image; scored against VIKR checklists under the intersection of Gemini-3.1-Pro and GPT-5.1 judges, unscored responses counted as failures. Source: arxiv.org. Saturation forecast: Around December 2026. 26 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)92.3
2Gemini 3 Flash86
3Claude Opus 574.7
4GPT-5.6 Sol72.5
5Kimi K2.571.1
6Qwen 3.6 Plus65.1
7GPT-5.6 Terra61.9
8Claude Sonnet 559.2
9Qwen 3 VL 235B A22B Instruct53.2
10Qwen 3.6 Flash53.2
11GPT-5.6 Luna52.1
12Qwen 3 VL 235B A22B (Thinking)50.2
13MiMo-V2-Omni48.1
14Qwen 3 VL 32B Instruct47.6
15MiMo-V2.547.2

Interactive version: theaggregate.ai/benchmark?slug=memebench-visual-clues · How It Works · Data refreshed daily, snapshot 2026-09-29.