ChessBench LLM: leaderboard

Evaluates LLM chess ability using Glicko-2 ratings calibrated with engine anchors. Tracks win/loss/draw records, move legality percentage, and cost per game.

Metric: Lichess Rating. Source: chessbenchllm.onrender.com. Status: years away from saturation. 110 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview) (High)2081
2Gemini 3.1 Pro (Preview) (Medium)2012
3Gemini 3.5 Flash (Medium)1920
4Gemini 3 Pro (Preview) (High)1914
5Gemini 3.6 Flash (Medium)1880
6Gemini 3 Flash (Preview) (Medium)1850
7Gemini 3 Flash (Preview) (High)1744
8GPT-5.6 Sol (High)1530
9GPT-5.6 Luna (xHigh)1469
10GPT-5.6 Sol (xHigh)1465
11GPT-5.1 (High)1401
12Grok 4.1 Fast1400
13GPT-5.6 Sol (Medium)1394
14O31333
15DeepSeek V4 Flash (0731) (High)1304

Interactive version: theaggregate.ai/benchmark?slug=chessbench-llm · How It Works · Data refreshed daily, snapshot 2026-09-05.