PGG-Bench (Lechmazur): leaderboard

Metric: TrueSkill μ. Source: github.com. 19 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)14.35
2O113.4
3Mistral Large 2 (Jul)11.93
4Gemini 2.0 Pro (Preview 02-05)11.14
5O3 Mini (Medium)11.11
6DeepSeek V310.94
7GPT-4.5 (Preview)10.77
8Llama 3.3 70B10.19
9Grok 2 (1212)10.12
10DeepSeek R19.66
11Qwen 2.5 Max9.46
12Claude 3.7 Sonnet9.33
13Llama 3.1 405B8.49
14Gemini 2.0 Flash (01-21) (Thinking)8.26
15Claude 3.5 Sonnet (20241022)8.05

Interactive version: theaggregate.ai/benchmark?slug=pgg-bench-lechmazur · How It Works · Data refreshed daily, snapshot 2026-09-19.