PerfCodeBench: leaderboard

Metric: CGRE (self-reported). Source: benchmarklist.com. 20 models tracked.

Top models

#ModelScore
1GPT-573.99
2Qwen 3.6 Max66.32
3GPT-5.466.27
4Claude Opus 4.565.09
5Qwen 3.6 27B65.07
6DeepSeek V4 Pro64.3
7Kimi K2.662.14
8Claude Sonnet 4.561.6
9Gemini 3.1 Pro (Preview)61.46
10DeepSeek V4 Flash61.25
11Seed 2.0 Lite60.19
12Qwen 3.6 Plus56.46
13Gemini 3.1 Flash45.89
14Kimi K244.73
15Qwen 3.6 35B A3B44.38

Interactive version: theaggregate.ai/benchmark?slug=perfcodebench · How It Works · Data refreshed daily, snapshot 2026-09-05.