AA SciCode — leaderboard

Artificial Analysis independent evaluation of SciCode: 338 sub-tasks from 80 real lab problems across 16 scientific disciplines.

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturation imminent. 538 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)58.91
2Kimi K358.68
3GPT-5.6 Sol (High)56.94
4GPT-5.4 (xHigh)56.6
5GPT-5.6 Sol (Medium)56.48
6GPT-5.5 (xHigh)56.13
7Gemini 3 Pro (Preview) (High)56.13
8GPT-5.6 Sol (Max)56.13
9GPT-5.6 Sol (xHigh)56.02
10GPT-5.5 (High)55.9
11GPT-5.6 Sol (Low)55.44
12GPT-5.2 Codex (xHigh)54.63
13Claude Opus 4.7 (Adaptive Reasoning, Max Effort)54.51
14Grok 4.5 (High)54.05
15GPT-5.6 Terra (Max)53.94

Interactive version: theaggregate.ai/benchmark?slug=aa-scicode · How the rankings work · Data refreshed daily, snapshot 2026-07-22.