scBench — leaderboard

Bioinformatics agent benchmark with verifiable single-cell RNA-seq workflow tasks and deterministic graders.

Metric: Accuracy (self-reported). Source: benchmarklist.com. Status: saturated. 21 models tracked.

Top models

#ModelScore
1Claude Mythos 559.3
2Claude Opus 4.858.2
3Claude Mythos Preview58.2
4GPT-5.557.95
5GPT-5.457.44
6Claude Opus 4.755.3
7Gemini 3.1 Pro (Preview)53.85
8Claude Opus 4.652.65
9GPT-5.252.31
10Claude Sonnet 4.650.4
11Claude Opus 4.547.18
12Grok 4.2044.44
13Grok 4.344.27
14GPT-5.138.8
15Claude Sonnet 4.533.16

Interactive version: theaggregate.ai/benchmark?slug=scbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.