URSA - Expert-2026 ChemCensor: leaderboard

Metric: Average ChemCensor plausibility score (out of 5) per reaction step along the best route per target, averaged over the 100 URSA-expert-2026 novel targets; URSA-minor-1.1.0-U2 configuration with ChemCensor v1.2.0 and the U2 USPTO precedent database; default reasoning effort; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 17 models tracked.

Top models

#ModelScore
1GPT-5.51.62
2Gemini 3.1 Pro (Preview)1.46
3Kimi K2.51.44
4Claude Opus 4.81.3
5Claude Opus 4.71.24
6Grok 4.11.22
7Claude Opus 4.51.03
8Claude Opus 4.61.02
9Qwen 3.5 397B A17B1
10GLM-51
11Claude Sonnet 4.60.99
12Claude Sonnet 4.50.98
13Grok 4.30.94
14DeepSeek V3.20.85
15GPT-5.40.71

Interactive version: theaggregate.ai/benchmark?slug=ursa-expert-2026-chemcensor · How It Works · Data refreshed daily, snapshot 2026-09-29.