MEGA-Bench Task - LLaVAGuard: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Qwen 2 VL 7B78.6
2GPT-4o Mini78.6
3Gemini 1.5 Flash (002)78.6
4InternVL3-38B71.4
5InternVL3-78B67.9
6InternVL2.5-78B67.9
7Qwen 2 VL 72B64.3
8Gemini 1.5 Pro (002)64.3
9GPT-4o60.7
10Gemma 3 4B (IT)57.1
11InternVL3-8B57.1
12Gemma 3 27B (IT)53.6
13Gemma 3 12B (IT)53.6
14Llama 4 Scout Base53.6
15InternVL2-8B42.9

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-llavaguard · How It Works · Data refreshed daily, snapshot 2026-09-05.