Vals AI SkillsBench: leaderboard
Metric: Accuracy (%). Source: www.vals.ai. 33 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Grok 4.5 (High) | 66.03 |
| 2 | Gemini 3.7 Flash (High) | 65.89 |
| 3 | GPT-5.5 (xHigh) | 62.21 |
| 4 | Claude Fable 5.1 (Max) | 61.55 |
| 5 | GPT-5.6 Luna (Max) | 60.45 |
| 6 | Claude Opus 5 (Max) | 60.44 |
| 7 | Claude Opus 4.8 (Max) | 59.23 |
| 8 | Muse Spark 1.1 (xHigh) | 59.19 |
| 9 | GPT-5.6 Terra (Max) | 58.9 |
| 10 | Gemini 3.8 Flash (High) | 57.98 |
| 11 | Grok 4.6 (High) | 55.77 |
| 12 | Qwen 3.7 Plus | 54.3 |
| 13 | GPT-5.6 Sol (Max) | 54.1 |
| 14 | DeepSeek V4 Pro (0813) (Max) | 53.83 |
| 15 | Muse Spark 1.2 (xHigh) | 53.04 |
Interactive version: theaggregate.ai/benchmark?slug=vals-ai-skillsbench · How It Works · Data refreshed daily, snapshot 2026-09-05.