MEGA-Bench Task - Defeasible Reasoning: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)88.3
2Claude 3.5 Sonnet (20240620)85.5
3Gemini 1.5 Flash (002)84.5
4Gemma 3 12B (IT)83.8
5Claude 3.5 Sonnet (20241022)83.8
6GPT-4o82.8
7InternVL3-78B82.8
8Llama 4 Scout Base82.1
9GPT-4o Mini81.7
10Gemma 3 27B (IT)81
11Gemini 1.5 Pro (002)79.7
12InternVL3-38B77.6
13Gemma 3 4B (IT)72.4
14InternVL2.5-78B72.4
15Qwen 2 VL 72B71.7

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-defeasible-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.