BioMysteryBench Human-Difficult: leaderboard

Anthropic BioMysteryBench slice covering 23 real-world bioinformatics tasks no human benchmarker solved after QC, evaluated by average accuracy across five trials per problem.

Metric: Accuracy (self-reported). Source: benchmarklist.com. Status: years away from saturation. 14 models tracked.

Top models

#ModelScore
1Gemini 3.8 Flash56.5
2Claude Opus 549.4
3GPT-5.6 Terra49.4
4Claude Mythos 546.1
5GPT-5.6 Sol44.7
6Gemini 3.7 Flash43.5
7Gemini 3.6 Flash41.2
8Claude Opus 4.840
9Claude Sonnet 534.1
10Claude Mythos Preview29.6
11Claude Opus 4.727
12Claude Opus 4.623.5
13Claude Sonnet 4.619.1
14Claude Haiku 4.55.2

Interactive version: theaggregate.ai/benchmark?slug=biomysterybench-human-difficult · How It Works · Data refreshed daily, snapshot 2026-09-05.