MEGA-Bench Task - Landmark Recognition And QA: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)75.6
2GPT-4o71.1
3Claude 3.5 Sonnet (20241022)71.1
4Gemini 1.5 Pro (002)66.7
5Qwen 2 VL 7B64.4
6Gemma 3 12B (IT)62.2
7Claude 3.5 Sonnet (20240620)60
8Gemma 3 4B (IT)57.8
9Qwen 2 VL 72B57.8
10Gemma 3 27B (IT)55.6
11Gemini 1.5 Flash (002)55.6
12InternVL3-38B53.3
13GPT-4o Mini53.3
14Pixtral-12B53.3
15InternVL3-78B51.1

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-landmark-recognition-and-qa · How It Works · Data refreshed daily, snapshot 2026-09-05.