AutoBench: leaderboard

Automated multi-metric LLM evaluation ranking models by cost, latency, and domain performance. Models ranked by aggregate score across practical business tasks.

Metric: Judge Rating (1-5). Source: autobench.org. Status: saturation imminent. 38 models tracked.

Top models

#ModelScore
1GPT-5.2 Pro4.48
2GPT-5.24.43
3Gemini 3 Pro (Preview)4.41
4Claude Opus 4.54.39
5GPT-5.14.38
6Kimi K2 (Thinking)4.32
7Claude Sonnet 4.54.3
8Gemini 3 Flash (Preview)4.3
9Gemini 2.5 Pro4.29
10GPT-5 Mini4.29
11Grok 4.1 Fast (Reasoning)4.21
12Grok 44.2
13Qwen 3 235B A22B 2507 (Thinking)4.2
14GPT-OSS-120B4.18
15Gemini 2.5 Flash4.17

Interactive version: theaggregate.ai/benchmark?slug=autobench · How It Works · Data refreshed daily, snapshot 2026-09-05.