MEGA-Bench Task - Pictionary GenAI Output Chinese — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro71.4
2Gemini 1.5 Pro (002)57.1
3InternVL3-78B50
4InternVL3-38B50
5Qwen 2 VL 72B42.9
6InternVL3-14B42.9
7Claude 3.5 Sonnet (20240620)35.7
8Gemini 2.0 Flash (Preview)35.7
9GPT-4o28.6
10Gemma 3 27B (IT)28.6
11InternVL2-8B28.6
12Claude 3.5 Sonnet (20241022)28.6
13InternVL2.5-78B28.6
14Ovis2-8B21.4
15GPT-4o Mini21.4

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-pictionary-genai-output-chinese · How the rankings work · Data refreshed daily, snapshot 2026-07-22.