MEGA-Bench Task - Flowchart Code Generation: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Llama 4 Scout Base77.8
2GPT-4o66.7
3InternVL3-78B66.7
4InternVL2-8B66.7
5Qwen 2 VL 72B66.7
6Gemini 1.5 Pro (002)66.7
7Pixtral-12B66.7
8Gemini 2.5 Pro (Preview 03-25)66.7
9Claude 3.5 Sonnet (20240620)66.7
10Gemma 3 27B (IT)55.6
11Gemma 3 12B (IT)55.6
12Claude 3.5 Sonnet (20241022)55.6
13GPT-4o Mini55.6
14InternVL2.5-78B55.6
15Gemma 3 4B (IT)44.4

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-flowchart-code-generation · How It Works · Data refreshed daily, snapshot 2026-09-05.