LiveBench Code Generation: leaderboard

Metric: Score. Source: livebench.ai. 54 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Max)91.55
2Claude Fable 5.1 (Max)90.14
3Claude Opus 4.7 (xHigh)85.92
4GPT-5.6 Sol (Max)83.1
5Claude Sonnet 5 (xHigh)83.1
6GPT-5.5 (xHigh)81.69
7Gemini 3.7 Flash (High)81.69
8Muse Spark 1.3 (xHigh)81.69
9Qwen 3.6 Plus80.28
10Kimi K380.28
11Gemini 3.5 Flash (High)80.28
12Claude Opus 5 (Max)80.28
13GPT-6 (Max)80.28
14GPT-5.2 Codex80.28
15Claude Opus 4.6 (Thinking, High)80.28

Interactive version: theaggregate.ai/benchmark?slug=livebench-code-generation · How It Works · Data refreshed daily, snapshot 2026-09-05.