Confidence Decision Faithfulness - GPQA Diamond - Policy Consistency: leaderboard

Metric: Policy Consistency (0-1). Source: arxiv.org. 10 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash0.89
2Gemini 3 Flash0.82
3DeepSeek V3.2 (Non-reasoning)0.76
4GPT-4.1 Mini0.76
5Qwen 3 Next 80B A3B (Thinking)0.75
6Gemma 3n E4B (IT)0.72
7Llama 4 Maverick0.71
8GPT-5 Mini0.71
9DeepSeek V3.2 (Thinking)0.69
10GPT-5 Nano0.57

Interactive version: theaggregate.ai/benchmark?slug=confidence-decision-faithfulness-gpqa-diamond-policy-consistency · How It Works · Data refreshed daily, snapshot 2026-09-19.