MEGA-Bench - Skill: Ethical And Safety Reasoning — leaderboard

Metric: Average Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro73.8
2Gemini 1.5 Pro (002)69.8
3Claude 3.5 Sonnet (20240620)69.7
4GPT-4o Mini69
5GPT-4o68
6Gemini 2.0 Flash (Preview)66.4
7Gemma 3 27B (IT)65.8
8Claude 3.5 Sonnet (20241022)65.7
9Gemini 1.5 Flash (002)65.7
10Gemma 3 12B (IT)62
11InternVL3-78B61.5
12Qwen 2 VL 72B61.2
13InternVL2.5-78B60.7
14InternVL3-38B60.3
15Gemma 3 4B (IT)56.9

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-skill-ethical-and-safety-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.