MEGA-Bench Task - GUI Chat Hard: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Qwen 2 VL 72B61
2InternVL2-8B60.3
3InternVL3-8B60
4Gemini 2.5 Pro (Preview 03-25)58.8
5InternVL3-38B56.5
6InternVL3-78B54.2
7Gemma 3 27B (IT)51.2
8Llama 4 Scout Base50.4
9GPT-4o49.4
10InternVL2.5-2B48.1
11Claude 3.5 Sonnet (20241022)45.8
12InternVL2.5-78B45.8
13Claude 3.5 Sonnet (20240620)45.8
14Qwen 2 VL 7B45.5
15Qwen 2 VL 2B45.5

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-gui-chat-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.