FINAL Bench Metacognitive: leaderboard

100 tasks across 15 domains from VIDRAFT/Ginigen AI (Seoul) scoring whether a model flags its own possible errors and then actually corrects them, graded on a five-axis rubric.

Metric: Metacognitive Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 9 models tracked.

Top models

#ModelScore
1Kimi K2.578.54
2Gemini 3 Pro77.08
3GPT-5.276.5
4GLM-576.38
5Claude Opus 4.676.17
6GPT-OSS-120B73.33
7DeepSeek V3.273.08

Interactive version: theaggregate.ai/benchmark?slug=final-bench-metacognitive · How It Works · Data refreshed daily, snapshot 2026-09-05.