LLM2014 Code 2025-09 - Python — leaderboard

Metric: Score. Source: raw.githubusercontent.com. 20 models tracked.

Top models

#ModelScore
1O4 Mini (High)9.17
2GPT-5 Mini (High)8.96
3Gemini 2.5 Pro7.5
4DeepSeek V3.1 (Thinking)7.36
5GLM-4.5 (Thinking)7.15
6Claude Sonnet 4 (Thinking)6.94
7Qwen 3 235B A22B 2507 Instruct6.18
8GLM-4.56.11
9Grok 45.76
10DeepSeek V3.15.69
11GPT-OSS-20B (High)5.62
12Claude Sonnet 45.42
13Gemini 2.5 Flash (Thinking)5.28
14Grok Code Fast 14.65
15GPT-OSS-120B (High)4.31

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-09-python · How the rankings work · Data refreshed daily, snapshot 2026-07-22.