MEGA-Bench Task - MFC Bench Check Out Of Context — leaderboard

Metric: Task Score (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GPT-4o85.7
2Qwen 2 VL 72B85.7
3Claude 3.5 Sonnet (20241022)85.7
4Gemini 1.5 Pro (002)85.7
5Gemini 1.5 Flash (002)85.7
6Qwen 2 VL 7B78.6
7GPT-4o Mini78.6
8InternVL2.5-78B78.6
9Qwen 2 VL 2B71.4
10Pixtral-12B64.3
11InternVL2-8B57.1
12MiniCPM-V-2.657.1
13Claude 3.5 Sonnet (20240620)57.1
14Aquila-VL-2B50
15InternVL2.5-2B50

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-mfc-bench-check-out-of-context · How the rankings work · Data refreshed daily, snapshot 2026-07-22.