LLM2014 Code 2025-11 — leaderboard

Metric: Multi-round Score. Source: raw.githubusercontent.com. 26 models tracked.

Top models

#ModelScore
1Gemini 3 Pro96
2GPT-5 Mini (High)93
3Claude Opus 4.590.75
4Claude Sonnet 4.5 (Thinking)81.67
5Claude Sonnet 4.575.25
6Gemini 2.5 Pro74.36
7DeepSeek V3.2 (Thinking)68
8GLM-4.6 (Thinking)66.81
9DeepSeek V3.265.28
10Qwen 3 Max63.95
11Kimi K2 (Thinking)55.75
12Kimi K2 090553.8
13MiniMax-M253.56
14Claude Haiku 4.551.44
15Ling-1T50.06

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-11 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.