LiveBench: leaderboard

Continuously updated benchmark measuring many capabilities. Sort models by weighted score or sub-task scores. Tests math, coding, reasoning, language, instruction following, and data analysis.

Metric: Score. Source: livebench.ai. Status: saturation imminent. 54 models tracked.

Top models

#ModelScore
1Claude Fable 5.1 (Max)92.97
2Claude Fable 5 (Max)92.84
3Claude Opus 5 (Max)92.8
4Claude Opus 4.8 (Max)92.23
5GPT-6 (Max)92.17
6Claude Opus 4.6 (Thinking, High)92.17
7Gemini 3.8 Flash (High)92.16
8Gemini 3.1 Pro (Preview) (High)92.1
9Gemini 3.5 Flash (High)91.88
10Gemini 3.7 Flash (High)91.79
11Muse Spark 1.3 (xHigh)91.74
12GPT-5.6 Sol (Max)91.69
13Kimi K391.65
14GPT-5.6 Terra (Max)91.53
15GPT-5.4 (xHigh)91.47

Interactive version: theaggregate.ai/benchmark?slug=livebench · How It Works · Data refreshed daily, snapshot 2026-09-05.