BioMysteryBench Human-Solvable: leaderboard

Anthropic BioMysteryBench slice covering 76 real-world bioinformatics tasks solved by at least one human benchmarker, evaluated by average accuracy across five trials per problem.

Metric: Accuracy (self-reported). Source: benchmarklist.com. Status: years away from saturation. 14 models tracked.

Top models

#ModelScore
1Claude Opus 590.1
2Gemini 3.8 Flash88.8
3Claude Sonnet 587.5
4Gemini 3.7 Flash87.1
5Claude Mythos 583.9
6GPT-5.6 Terra83.8
7Claude Mythos Preview82.6
8Gemini 3.6 Flash80.6
9Claude Opus 4.880.4
10GPT-5.6 Sol79.5
11Claude Opus 4.778.9
12Claude Opus 4.677.4
13Claude Sonnet 4.671.8
14Claude Haiku 4.536.8

Interactive version: theaggregate.ai/benchmark?slug=biomysterybench-human-solvable · How It Works · Data refreshed daily, snapshot 2026-09-05.