SciDesignBench - Optimization: leaderboard

Metric: One-turn design optimization: the model receives a starting design with its measured properties and must modify it to meet new targets (success also requires changing the design); mean success rate (%) over the 10 optimization shared-core domains, 20 tasks each, averaged over K = 3 attempts; higher is better. Source: arxiv.org. Saturation forecast: Around September 2028. 7 models tracked.

Top models

#ModelScoreOverall rank
1Claude Opus 4.634.5#60
2Gemini 3.1 Pro (Preview)31.3#54
3Claude Sonnet 4.631.2#85
4Claude Sonnet 4.530.5#138
5GPT-5.229#105
6Gemini 2.0 Flash22.2#331
7GPT-4o17.8#333

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=scidesignbench-optimization · How It Works · Data refreshed daily, snapshot 2026-10-11.