Self-Explanation Simulatability (NSG): leaderboard

Metric: Normalized Simulatability Gain (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1Gemma 3 4B36.51
2Qwen 3 32B35.61
3Gemma 3 27B34.92
4GPT-5.234.72
5GPT-5 Mini34.25
6Qwen 3 14B33.9
7Claude Sonnet 4.533.78
8Gemma 3 12B33.74
9GPT-5 Nano32.81
10Gemini 3 Flash30.79
11Qwen 3 8B29.24
12Claude Opus 4.528.38
13Gemini 3 Pro28.38
14Claude Haiku 4.526.8
15Qwen 3 4B24.19

Interactive version: theaggregate.ai/benchmark?slug=self-explanation-simulatability-nsg · How It Works · Data refreshed daily, snapshot 2026-09-21.