MEGA-Bench Task - Semantic Matching Of Two Images — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1GPT-4o64.3
2Claude 3.5 Sonnet (20241022)50
3Claude 3.5 Sonnet (20240620)50
4Gemini 2.5 Pro42.9
5Gemma 3 12B (IT)42.9
6Gemma 3 27B (IT)35.7
7InternVL3-78B35.7
8Gemini 1.5 Pro (002)35.7
9Gemini 2.0 Flash (Preview)35.7
10InternVL3-38B28.6
11Pixtral-12B28.6
12InternVL2.5-2B28.6
13InternVL3-8B21.4
14Qwen 2 VL 72B21.4
15InternVL3-14B21.4

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-semantic-matching-of-two-images · How the rankings work · Data refreshed daily, snapshot 2026-07-22.