MEGA-Bench Task - Research Website Parsing Homepage: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemma 3 12B (IT)35.7
2GPT-4o28.6
3InternVL3-78B28.6
4InternVL2-8B28.6
5Qwen 2 VL 72B28.6
6InternVL3-38B28.6
7Gemini 1.5 Pro (002)28.6
8Llama 4 Scout Base28.6
9Qwen 2 VL 7B21.4
10Claude 3.5 Sonnet (20241022)21.4
11Aquila-VL-2B21.4
12GPT-4o Mini21.4
13Gemini 1.5 Flash (002)21.4
14Gemini 2.5 Pro (Preview 03-25)21.4
15Gemma 3 27B (IT)14.3

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-research-website-parsing-homepage · How It Works · Data refreshed daily, snapshot 2026-09-05.