MEGA-Bench Task - Research Website Parsing Blog Post — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1InternVL3-78B21.4
2InternVL3-8B21.4
3Qwen 2 VL 72B21.4
4Qwen 2 VL 7B21.4
5Qwen 2 VL 2B14.3
6InternVL3-14B14.3
7Llama 4 Scout Base14.3
8GPT-4o7.1
9Gemma 3 27B (IT)7.1
10Gemma 3 12B (IT)7.1
11Gemma 3 4B (IT)7.1
12InternVL2-8B7.1
13InternVL3-38B7.1
14Claude 3.5 Sonnet (20241022)7.1
15MiniCPM-V-2.67.1

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-research-website-parsing-blog-post · How the rankings work · Data refreshed daily, snapshot 2026-07-22.