Conceptual Reasoning Index - Argument Evaluation (LMCA): leaderboard

Metric: Chance-Corrected Score (0-100). Source: conceptualreasoning.ai. 136 models tracked.

Top models

#ModelScore
1Claude Opus 5 (Max)63.3
2Claude Fable 5 (Max)60.34
3GPT-5.6 Sol (Max)58.43
4Claude Opus 4.8 (Max)57.51
5Claude Opus 4.6 (Max)55.76
6GPT-5.5 (xHigh)54.27
7GPT-5.5 Pro (xHigh)53.94
8Gemini 3.1 Pro (Preview) (High)53.82
9Kimi K3 (Max)52.74
10GPT-5.6 Terra (Max)52.23
11Claude Opus 4.7 (Max)52.2
12GPT-5.4 (xHigh)51.97
13Gemini 3.7 Flash (High)50.38
14Muse Spark 1.1 (High)49.91
15Claude Sonnet 5 (Max)49.31

Interactive version: theaggregate.ai/benchmark?slug=conceptual-reasoning-index-argument-evaluation-lmca · How It Works · Data refreshed daily, snapshot 2026-09-05.