MEGA-Bench - Skill: Ethical And Safety Reasoning: leaderboard

Metric: Average Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)73.8
2Gemini 1.5 Pro (002)69.8
3Claude 3.5 Sonnet (20240620)69.7
4GPT-4o Mini69
5GPT-4o68
6Gemma 3 27B (IT)65.8
7Claude 3.5 Sonnet (20241022)65.7
8Gemini 1.5 Flash (002)65.7
9Gemma 3 12B (IT)62
10InternVL3-78B61.5
11Qwen 2 VL 72B61.2
12InternVL2.5-78B60.7
13InternVL3-38B60.3
14Gemma 3 4B (IT)56.9
15InternVL3-8B54.2

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-skill-ethical-and-safety-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.