Surface Evolver Bench — leaderboard

Metric: Mean Score (%). Source: yhenon.github.io. 23 models tracked.

Top models

#ModelScore
1Kimi K395
2Claude Fable 5 (High)95
3GPT-5.6 Sol (xHigh)93.12
4GPT-5.5 (High)88.12
5Claude Opus 4.8 (High)87.5
6GPT-5.6 Terra (xHigh)83.75
7GPT-5.5 (Medium)81.25
8Grok 4.5 (High)74.38
9Claude Opus 4.868.12
10GPT-5.6 Luna (Medium)61.88
11Gemini 3.5 Flash (Medium)58.13
12GLM-5.2 (High)55.62
13MiniMax-M355
14Kimi K2.7 Code48.75
15Qwen 3.6 35B A3B44.38

Interactive version: theaggregate.ai/benchmark?slug=surface-evolver-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.