MEGA-Bench Task - Functionality Matching In Different Objects: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1InternVL3-38B78.6
2Gemini 1.5 Pro (002)71.4
3Gemini 2.5 Pro (Preview 03-25)67.9
4GPT-4o64.3
5InternVL3-78B60.7
6Claude 3.5 Sonnet (20241022)57.1
7Gemma 3 27B (IT)53.6
8Qwen 2 VL 72B53.6
9Claude 3.5 Sonnet (20240620)53.6
10Gemini 1.5 Flash (002)46.4
11InternVL2.5-78B42.9
12InternVL3-8B39.3
13Gemma 3 12B (IT)35.7
14GPT-4o Mini35.7
15Pixtral-12B35.7

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-functionality-matching-in-different-objects · How It Works · Data refreshed daily, snapshot 2026-09-05.