VASPBench (AutoDFT-OpenLoop): leaderboard

Metric: Task success rate (%; converged outputs passing the validation checks on 34 DFT tasks, one up-front LLM plan then deterministic execution, one run per task). Source: arxiv.org. Saturation forecast: Around December 2026. 3 models tracked.

Top models

#ModelScore
1GPT-5.282.4
2Gemini 3.1 Pro (Preview)76.5
3Claude Sonnet 4.676.5

Interactive version: theaggregate.ai/benchmark?slug=vaspbench-autodft-openloop · How It Works · Data refreshed daily, snapshot 2026-09-26.