MEGA-Bench Task - Image Captioning With Additional Requirements: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)94.3
2Gemini 2.5 Pro (Preview 03-25)93.6
3Claude 3.5 Sonnet (20240620)93.6
4InternVL3-38B92.9
5GPT-4o92.1
6InternVL3-78B92.1
7InternVL2.5-78B91.4
8GPT-4o Mini90
9Gemma 3 12B (IT)89.3
10Gemma 3 27B (IT)88.6
11Gemini 1.5 Pro (002)88.6
12InternVL3-8B86.4
13Llama 4 Scout Base86.4
14Qwen 2 VL 72B85.7
15Pixtral-12B85.7

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-image-captioning-with-additional-requirements · How It Works · Data refreshed daily, snapshot 2026-09-05.