Metacognition-Bench — leaderboard

Metric: Trap Resistance (100 × (1 − trap rate), higher is better). Source: huggingface.co. 40 models tracked.

Top models

#ModelScore
1Qwen 3.5 27B99
2Gemma 4 31B (IT)98.5
3Qwen 3.5 35B A3B98
4Mistral Small 3.297.7
5Qwen 3.5 9B96.5
6gemma-4-E4B-it95.2
7Qwen 3.6 35B A3B95
8Qwen 3.5 4B94.7
9Gemma 4 12B (IT)94.7
10Gemma 4 26B A4B (IT)94.5
11Qwen 3 1.7B66.4
12LFM2.5-1.2B (Thinking)29.3
13DeepSeek R1 Distill Qwen 1.5B22.8

Interactive version: theaggregate.ai/benchmark?slug=metacognition-bench · How It Works · Data refreshed daily, snapshot 2026-07-25.