MEGA-Bench Task - GUI Chat Hard — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Ovis2-8B70.4
2Qwen 2 VL 72B61
3InternVL2-8B60.3
4InternVL3-8B60
5Gemini 2.5 Pro58.8
6InternVL3-38B56.5
7InternVL3-78B54.2
8InternVL3-14B53.1
9Gemma 3 27B (IT)51.2
10Llama 4 Scout Base50.4
11GPT-4o49.4
12MiniCPM-V-2.648.4
13InternVL2.5-2B48.1
14Claude 3.5 Sonnet (20241022)45.8
15InternVL2.5-78B45.8

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-gui-chat-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.