BenchTable - Utility: leaderboard

Metric: Weighted Score (%). Source: dubesor.de. 347 models tracked.

Top models

#ModelScore
1Kimi K2.5 (Thinking)87.4
2Grok 4.20 (Reasoning)87.4
3Claude Opus 4.784.5
4GPT-5 Chat83.6
5GPT-4o82.6
6Grok 482.6
7Kimi K2 (Thinking)82.6
8DeepSeek V3.2 Speciale82.6
9Gemini 2.5 Flash (Preview 05-20) (Thinking)82.2
10Llama 3.1 405B Instruct81.5
11Claude Sonnet 4.680.1
12Gemini 3.1 Flash Lite (Preview)79.7
13GPT-4 Turbo79.5
14Gemini 2.5 Pro79
15Gemini 3 Flash (Preview)78.8

Interactive version: theaggregate.ai/benchmark?slug=benchtable-utility · How It Works · Data refreshed daily, snapshot 2026-09-19.