MEGA-Bench Task - Defeasible Reasoning — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro88.3
2Gemini 2.0 Flash (Preview)86.2
3Claude 3.5 Sonnet (20240620)85.5
4Gemini 1.5 Flash (002)84.5
5Gemma 3 12B (IT)83.8
6Claude 3.5 Sonnet (20241022)83.8
7GPT-4o82.8
8InternVL3-78B82.8
9Llama 4 Scout Base82.1
10GPT-4o Mini81.7
11Gemma 3 27B (IT)81
12Gemini 1.5 Pro (002)79.7
13InternVL3-38B77.6
14InternVL3-14B75.5
15Gemma 3 4B (IT)72.4

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-defeasible-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.