AA SciCode: leaderboard

Artificial Analysis independent evaluation of SciCode: 338 sub-tasks from 80 real lab problems across 16 scientific disciplines.

Metric: Score. Source: epoch.ai. Status: years away from saturation. 159 models tracked.

Top models

#ModelScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)62.04
2Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)60.19
3Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)60.07
4Gemini 3.1 Pro (Preview)58.91
5Kimi K358.68
6Kimi K3 (Max)58.68
7Muse Spark 1.1 (xHigh)58.22
8Gemini 3.7 Flash (Medium)57.87
9Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)57.64
10GPT-5.6 Sol (High)56.94
11Gemini 3.7 Flash (High)56.83
12GPT-5.4 (xHigh)56.6
13GLM-5.3 (Max)56.48
14GPT-5.6 Sol (Medium)56.48
15Muse Spark 1.2 (xHigh)56.37

Interactive version: theaggregate.ai/benchmark?slug=aa-scicode · How It Works · Data refreshed daily, snapshot 2026-09-05.