MEGA-Bench Task - Functionality Matching In Different Objects — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1InternVL3-38B78.6
2Gemini 1.5 Pro (002)71.4
3Gemini 2.0 Flash (Preview)71.4
4Gemini 2.5 Pro67.9
5GPT-4o64.3
6InternVL3-78B60.7
7InternVL3-14B60.7
8Claude 3.5 Sonnet (20241022)57.1
9Gemma 3 27B (IT)53.6
10Qwen 2 VL 72B53.6
11Claude 3.5 Sonnet (20240620)53.6
12Gemini 1.5 Flash (002)46.4
13InternVL2.5-78B42.9
14InternVL3-8B39.3
15Gemma 3 12B (IT)35.7

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-functionality-matching-in-different-objects · How the rankings work · Data refreshed daily, snapshot 2026-07-22.