MEGA-Bench Task - Code Visualization Output Understanding — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1InternVL3-38B70
2Claude 3.5 Sonnet (20240620)60
3Gemini 2.5 Pro50
4InternVL3-78B50
5Gemini 1.5 Pro (002)50
6Gemini 2.0 Flash (Preview)50
7GPT-4o40
8Gemma 3 27B (IT)40
9Gemma 3 12B (IT)40
10Qwen 2 VL 72B30
11Qwen 2 VL 7B30
12InternVL3-14B30
13Claude 3.5 Sonnet (20241022)30
14GPT-4o Mini30
15Llama 4 Scout Base30

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-code-visualization-output-understanding · How the rankings work · Data refreshed daily, snapshot 2026-07-22.