MolViBench - Level 5 Create: leaderboard

Metric: Pass@1 (%) on the 64 Level 5 tasks (Create), direct generation in one pass with no execution feedback, RDKit molecular coding tasks answered by generated Python code, official APIs, temperature 0, at most 4,096 output tokens; higher is better. Source: arxiv.org. Saturation forecast: Around 2030. 9 models tracked.

Top models

#ModelScore
1GPT-5.2 Codex9.4
2Gemini 3 Pro7.8
3DeepSeek V3.2 (Non-reasoning)7.8
4Claude Opus 4.66.2
5DeepSeek V3.2 (Thinking)6.2
6Claude Opus 4.6 (Thinking)6.2
7GPT-5.3 Codex6.2
8Kimi K2.54.7
9MiniMax-M2.53.1

Interactive version: theaggregate.ai/benchmark?slug=molvibench-level-5-create · How It Works · Data refreshed daily, snapshot 2026-10-07.