MemeBench - Knowledge Units: leaderboard

Metric: Knowledge-unit coverage (%) on 1,253 Chinese and English memes centred on anime, comics, games and online subcultures, explained closed-book from the image; scored against VIKR checklists under the intersection of Gemini-3.1-Pro and GPT-5.1 judges, unscored responses counted as failures. Source: arxiv.org. Saturation forecast: Around December 2026. 26 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)69.7
2Gemini 3 Flash65.5
3GPT-5.6 Sol55.1
4Kimi K2.554.5
5Claude Opus 550.9
6Qwen 3.6 Plus42.8
7GPT-5.6 Terra42
8GPT-5.6 Luna31.3
9Claude Sonnet 530.2
10MiMo-V2.526.9
11MiMo-V2-Omni26.4
12Qwen 3 VL 235B A22B Instruct26.1
13Qwen 3.6 Flash25.7
14Qwen 3 VL 235B A22B (Thinking)22.9
15Qwen 3 VL 32B Instruct19.1

Interactive version: theaggregate.ai/benchmark?slug=memebench-knowledge-units · How It Works · Data refreshed daily, snapshot 2026-09-29.