LLM2014 Code 2025-11 - Python — leaderboard

Metric: Score. Source: raw.githubusercontent.com. 26 models tracked.

Top models

#ModelScore
1Gemini 3 Pro10
2Claude Opus 4.59.33
3GPT-5 Mini (High)9.2
4Claude Sonnet 4.5 (Thinking)8.88
5DeepSeek V3.2 (Thinking)8.08
6Gemini 2.5 Pro7.9
7Qwen 3 Max7.62
8MiniMax-M27.57
9GLM-4.6 (Thinking)7.22
10Claude Sonnet 4.57.15
11GLM-4.66.75
12DeepSeek V3.26.72
13Kimi K2 (Thinking)6.42
14Ling-1T5.4
15Claude Haiku 4.54.87

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-11-python · How the rankings work · Data refreshed daily, snapshot 2026-07-22.