AA CritPt: leaderboard

Artificial Analysis independent evaluation of CritPt: 71 research-level physics reasoning tasks across 11 subfields.

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturation imminent. 517 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)32.29
2GPT-6 (Max)31.71
3GPT-6 (xHigh)31.43
4Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)31.14
5GPT-5.5 Pro (xHigh)30.57
6Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)30.29
7GPT-5.6 Terra (Max)30
8GPT-5.4 Pro (xHigh)30
9Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)29.71
10Claude Opus 5 (Adaptive Reasoning, Max Effort)29.14
11GPT-6 (Medium)29.14
12Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)29.14
13GPT-6 (High)28.86
14Claude Mythos 528.6
15GPT-5.6 Sol (xHigh)28.57

Interactive version: theaggregate.ai/benchmark?slug=aa-critpt · How It Works · Data refreshed daily, snapshot 2026-09-05.