ChessBench: leaderboard

Chess benchmark where language models play rated games against fixed reference opponents, scored on rule-compliant play, move quality, and Monte Carlo Elo.

Metric: Overall Score (%). Source: chessbench.ai. Status: years away from saturation. 61 models tracked.

Top models

#ModelScore
1Gemini 3.8 Flash75.9
2GPT-5.562.9
3Gemini 3.7 Flash62.8
4Gemini 3.1 Pro (Preview)56.4
5GPT-5.6 Sol54.8
6Gemini 3.6 Flash54.8
7Gemini 3.5 Flash52
8Muse Spark 1.351.8
9GPT-5.447.7
10Muse Spark 1.242.7
11Claude Fable 541
12O339.2
13GPT-5.137
14Muse Spark 1.136.8
15GPT-5.6 Terra36

Interactive version: theaggregate.ai/benchmark?slug=chessbench · How It Works · Data refreshed daily, snapshot 2026-09-19.