MemeBench (Chinese): leaderboard

Metric: Success rate (%) on the 768 Chinese memes of 1,253 Chinese and English memes centred on anime, comics, games and online subcultures, explained closed-book from the image; scored against VIKR checklists under the intersection of Gemini-3.1-Pro and GPT-5.1 judges, unscored responses counted as failures. Source: arxiv.org. Saturation forecast: Around August 2027. 26 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)49.9
2Gemini 3 Flash41.8
3GPT-5.6 Sol33.1
4Kimi K2.532.4
5Claude Opus 528.3
6Qwen 3.6 Plus25.5
7GPT-5.6 Terra22.3
8GPT-5.6 Luna15.5
9Claude Sonnet 512.2
10MiMo-V2-Omni10.8
11Qwen 3.6 Flash10.5
12Qwen 3 VL 235B A22B Instruct10.2
13MiMo-V2.59.9
14Qwen 3 VL 235B A22B (Thinking)9.6
15Qwen 3 VL 32B Instruct5.9

Interactive version: theaggregate.ai/benchmark?slug=memebench-chinese · How It Works · Data refreshed daily, snapshot 2026-09-29.