Right Answer, Wrong Method - Derivation-Adjusted Accuracy: leaderboard

Metric: Correct and not flagged as hacked (%; detector-audited). Source: arxiv.org. 11 models tracked.

Top models

#ModelScore
1Kimi K341.7
2Gemini 3.1 Pro (Preview)40.4
3GPT-5.538
4Qwen 3.7 Max37.5
5DeepSeek V4 Pro34.8
6Claude Opus 4.733.1
7GLM-5.230.1
8Claude Opus 4.826
9GPT-5.215.8
10DeepSeek V3.211
11GPT-4.15.7

Interactive version: theaggregate.ai/benchmark?slug=right-answer-wrong-method-derivation-adjusted-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-19.