scBench: leaderboard

Bioinformatics agent benchmark with verifiable single-cell RNA-seq workflow tasks and deterministic graders.

Metric: Accuracy (self-reported). Source: benchmarklist.com. Status: saturation imminent. 17 models tracked.

Top models

#ModelScore
1Claude Mythos 559.3
2Claude Opus 4.858.2
3Claude Mythos Preview58.2
4GPT-5.557.95
5GPT-5.457.44
6Claude Opus 4.755.3
7Gemini 3.1 Pro (Preview)53.85
8Claude Opus 4.652.65
9GPT-5.252.31
10Claude Sonnet 4.650.4
11Claude Opus 4.547.18
12Grok 4.20 Beta (0309) (Reasoning)44.44
13Grok 4.344.27
14GPT-5.138.8
15Claude Sonnet 4.533.16

Interactive version: theaggregate.ai/benchmark?slug=scbench · How It Works · Data refreshed daily, snapshot 2026-09-05.