MemeBench: leaderboard

Metric: Success rate (%; visual, identity, knowledge and reasoning checklists all passed) on 1,253 Chinese and English memes centred on anime, comics, games and online subcultures, explained closed-book from the image; scored against VIKR checklists under the intersection of Gemini-3.1-Pro and GPT-5.1 judges, unscored responses counted as failures. Source: arxiv.org. Saturation forecast: Around March 2027. 26 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)60.3
2Gemini 3 Flash53.7
3GPT-5.6 Sol40.9
4Claude Opus 538.3
5Kimi K2.537.9
6Qwen 3.6 Plus28.4
7GPT-5.6 Terra27.8
8GPT-5.6 Luna18
9Claude Sonnet 517.8
10Qwen 3 VL 235B A22B Instruct14.5
11MiMo-V2-Omni14.3
12MiMo-V2.513.7
13Qwen 3.6 Flash12.3
14Qwen 3 VL 235B A22B (Thinking)12
15Qwen 3 VL 32B Instruct8.4

Interactive version: theaggregate.ai/benchmark?slug=memebench · How It Works · Data refreshed daily, snapshot 2026-09-29.