BenchTable - Utility: leaderboard
Metric: Weighted Score (%). Source: dubesor.de. 347 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Kimi K2.5 (Thinking) | 87.4 |
| 2 | Grok 4.20 (Reasoning) | 87.4 |
| 3 | Claude Opus 4.7 | 84.5 |
| 4 | GPT-5 Chat | 83.6 |
| 5 | GPT-4o | 82.6 |
| 6 | Grok 4 | 82.6 |
| 7 | Kimi K2 (Thinking) | 82.6 |
| 8 | DeepSeek V3.2 Speciale | 82.6 |
| 9 | Gemini 2.5 Flash (Preview 05-20) (Thinking) | 82.2 |
| 10 | Llama 3.1 405B Instruct | 81.5 |
| 11 | Claude Sonnet 4.6 | 80.1 |
| 12 | Gemini 3.1 Flash Lite (Preview) | 79.7 |
| 13 | GPT-4 Turbo | 79.5 |
| 14 | Gemini 2.5 Pro | 79 |
| 15 | Gemini 3 Flash (Preview) | 78.8 |
Interactive version: theaggregate.ai/benchmark?slug=benchtable-utility · How It Works · Data refreshed daily, snapshot 2026-09-19.