PerfCodeBench — leaderboard

Metric: CGRE (self-reported). Source: benchmarklist.com. 20 models tracked.

Top models

#ModelScore
1GPT-573.99
2GPT-5.466.27
3Claude Opus 4.565.09
4Qwen 3.6 27B65.07
5DeepSeek V4 Pro64.3
6Claude Sonnet 4.561.6
7Gemini 3.1 Pro (Preview)61.46
8DeepSeek V4 Flash61.25
9Qwen 3.6 Plus56.46
10Gemini 3.1 Flash45.89
11Qwen 3.6 35B A3B44.38
12Llama 4 Maverick43.72
13Gemma 4 26B A4B38.13
14Gemma 4 31B36.69
15Llama 4 Scout19.6

Interactive version: theaggregate.ai/benchmark?slug=perfcodebench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.