MEGA-Bench Task - DOCCI Image Description Long: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)86.4
2GPT-4o84.3
3InternVL3-78B80
4InternVL3-8B80
5Claude 3.5 Sonnet (20241022)79.3
6Claude 3.5 Sonnet (20240620)79.3
7InternVL2.5-78B77.9
8Gemini 1.5 Flash (002)76.4
9InternVL3-38B75.7
10Gemini 1.5 Pro (002)75.7
11Qwen 2 VL 72B75
12GPT-4o Mini72.1
13Gemma 3 27B (IT)68.6
14Qwen 2 VL 7B67.9
15Llama 4 Scout Base67.1

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-docci-image-description-long · How It Works · Data refreshed daily, snapshot 2026-09-05.