BridgeBench Overall: leaderboard

BridgeBench V3 coding leaderboard: each model is rated 1-10 on nine axes (reasoning, front end, back end, one-shot, security, trust, laziness, speed, cost) and ranked by Overall, the mean of the nine. Laziness and cost are inverted so higher is better. Speed and cost are not capability measures, so cheap, fast models gain on Overall. It replaced the head-to-head arena ladder in September 2026.

Metric: Overall (mean of nine axes, 1-10). Source: www.bridgebench.ai. Saturation forecast: Around December 2027. 12 models tracked.

Top models

#ModelScore
1GPT-67.2
2Claude Fable 5.16.9
3Claude Fable 55.9
4GPT-5.6 Sol5.7
5Grok 4.65.6
6Claude Opus 55.1
7Kimi K35
8GLM-5.34.9
9GPT-5.6 Terra4.8
10DeepSeek V4 Pro4.7
11GLM-5.3 Flash4.6
12GPT-5.6 Luna4.5

Interactive version: theaggregate.ai/benchmark?slug=bridgebench-overall · How It Works · Data refreshed daily, snapshot 2026-09-23.