MEGA-Bench Task - Humor Explanation: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)96
2GPT-4o86.7
3Gemini 1.5 Flash (002)85.3
4GPT-4o Mini82
5Gemini 1.5 Pro (002)80
6Gemma 3 27B (IT)79.3
7Claude 3.5 Sonnet (20241022)72.7
8Gemma 3 12B (IT)70
9InternVL2.5-78B68.7
10Gemma 3 4B (IT)66.7
11Claude 3.5 Sonnet (20240620)58.7
12InternVL3-8B55.3
13InternVL3-78B54.7
14Qwen 2 VL 72B54.7
15Llama 4 Scout Base53.3

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-humor-explanation · How It Works · Data refreshed daily, snapshot 2026-09-05.