MEGA-Bench Task - Pictionary GenAI Output Chinese: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)71.4
2Gemini 1.5 Pro (002)57.1
3InternVL3-78B50
4InternVL3-38B50
5Qwen 2 VL 72B42.9
6Claude 3.5 Sonnet (20240620)35.7
7Gemma 3 27B (IT)28.6
8GPT-4o28.6
9InternVL2-8B28.6
10Claude 3.5 Sonnet (20241022)28.6
11InternVL2.5-78B28.6
12GPT-4o Mini21.4
13Gemini 1.5 Flash (002)21.4
14Gemma 3 12B (IT)14.3
15Llama 4 Scout Base14.3

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-pictionary-genai-output-chinese · How It Works · Data refreshed daily, snapshot 2026-09-05.