LLM Stats (NOVA-63): leaderboard
Metric: Score (%). Source: llm-stats.com. 11 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen 3.5 397B A17B | 59.1 |
| 2 | Claude Opus 4.6 (Thinking) | 59.1 |
| 3 | Qwen 3.7 Max | 59 |
| 4 | Qwen 3.7 Plus | 58.8 |
| 5 | Qwen 3.5 122B A10B | 58.6 |
| 6 | Qwen 3.5 27B | 58.1 |
| 7 | Qwen 3.6 Plus | 57.9 |
| 8 | Qwen 3.5 35B A3B | 57.1 |
| 9 | Kimi K2.6 (Thinking) | 56.7 |
| 10 | Qwen 3.5 9B | 55.9 |
| 11 | GLM-5.1 (Thinking) | 54.6 |
| 12 | Qwen 3.5 4B | 54.3 |
| 13 | DeepSeek V4 Pro (Reasoning, Max Effort) | 52.8 |
| 14 | Qwen 3.5 2B | 46.4 |
| 15 | Qwen 3.5 0.8B | 42.4 |
Interactive version: theaggregate.ai/benchmark?slug=llm-stats-nova-63 · How It Works · Data refreshed daily, snapshot 2026-09-05.