BridgeBench Arena: leaderboard

Head-to-head coding arena: one unified confidence-weighted Elo ladder over seven task domains (reasoning, hallucination, security, refactoring, debugging, spec conformance, bullshit), decided by seeded blind matches judged 3-of-7 by a vendor-disjoint model panel. Domain filters slice the same match record rather than forming separate ladders.

Metric: Confidence-weighted Elo. Source: www.bridgebench.ai. Status: years away from saturation. 24 models tracked.

Top models

#ModelScore
1Claude Opus 51009.8
2Qwen 3.7 Max1008.7
3Claude Fable 51005.3
4GPT-5.6 Luna1005.1
5Claude Opus 4.61004
6GPT-5.6 Sol1003
7MiniMax-M31001.5
8GPT-OSS-120B1000.2
9GPT-5.6 Terra1000.2
10Inkling1000.2
11GPT-5.51000
12Claude Sonnet 51000
13Muse Spark 1.11000
14DeepSeek V4 Pro999.8
15DeepSeek V4 Flash999.8

Interactive version: theaggregate.ai/benchmark?slug=bridgebench-arena · How It Works · Data refreshed daily, snapshot 2026-09-20.