Benchmarks.bio - SpatialBench-Long — leaderboard

Long-form Benchmarks.bio spatial transcriptomics tasks that require multi-step biological data analysis, tool use, and synthesis over larger assay contexts.

Metric: Pass Rate (%). Source: benchmarks.bio. Status: saturation imminent. 18 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol38.89
2GPT-5.6 Terra22.22
3Grok 4.519.44
4GPT-5.6 Luna18.06
5Claude Sonnet 512.5
6GPT-5.511.11
7Claude Opus 4.811.11
8Gemini 3.5 Flash11.11
9Claude Opus 4.69.72
10Claude Opus 4.78.33
11Claude Opus 4.8 (Max)8.33
12Grok 4.20 Beta (0309) (Reasoning)6.94
13GPT-5.45.56
14Kimi K2.65.56
15Claude Sonnet 4.64.17

Interactive version: theaggregate.ai/benchmark?slug=benchmarks-bio-spatialbench-long · How the rankings work · Data refreshed daily, snapshot 2026-07-22.