VulcanBench v3 (BenchLM): leaderboard

Metric: Pass@1 (%). Source: benchlm.ai. 14 models tracked.

Top models

#ModelScore
1Grok 4.589.9
2Claude Fable 589.5
3DeepSeek V4 Flash (0731)88.4
4GPT-5.6 Sol87
5Claude Opus 587
6GPT-5.6 Terra87
7Grok 4.687
8Muse Spark 1.287
9GPT-5.6 Luna85.5
10Qwen 3.8 27B82.6
11Qwen 3.8 Max81.2
12GLM-5.378.3
13Claude Haiku 4.576.2
14Kimi K373.7

Interactive version: theaggregate.ai/benchmark?slug=vulcanbench-v3-benchlm · How It Works · Data refreshed daily, snapshot 2026-09-19.