BridgeBench Arena — leaderboard

Head-to-head coding arena: one unified confidence-weighted Elo ladder over seven task domains (reasoning, hallucination, security, refactoring, debugging, spec conformance, bullshit), decided by seeded blind matches judged 3-of-7 by a vendor-disjoint model panel. Domain filters slice the same match record rather than forming separate ladders.

Metric: Confidence-weighted Elo. Source: www.bridgebench.ai. Status: years away from saturation. 28 models tracked.

Top models

#ModelScore
1Claude Fable 51005.3
2Qwen 3.7 Max1005.3
3Claude Opus 4.71005.1
4Claude Opus 4.81005.1
5GPT-5.6 Sol1005.1
6GLM-5.21005.1
7GPT-5.6 Luna1005.1
8MiniMax-M31001.5
9Claude Opus 51001.5
10GPT-OSS-120B1000.2
11GPT-5.6 Terra1000.2
12Inkling1000.2
13GPT-5.51000
14Claude Opus 4.61000
15Claude Sonnet 51000

Interactive version: theaggregate.ai/benchmark?slug=bridgebench-arena · How It Works · Data refreshed daily, snapshot 2026-08-06.