MEGA-Bench Task - App Interactive Operations Word: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 1.5 Pro (002)71.4
2Gemini 2.5 Pro (Preview 03-25)71.4
3Qwen 2 VL 7B50
4Qwen 2 VL 72B42.9
5Claude 3.5 Sonnet (20241022)42.9
6Gemini 1.5 Flash (002)42.9
7InternVL2.5-78B35.7
8Gemma 3 27B (IT)28.6
9GPT-4o28.6
10GPT-4o Mini28.6
11Claude 3.5 Sonnet (20240620)28.6
12InternVL3-78B7.1
13InternVL3-38B7.1
14Qwen 2 VL 2B7.1
15Pixtral-12B7.1

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-app-interactive-operations-word · How It Works · Data refreshed daily, snapshot 2026-09-05.