LLM2014 Code 2025-07 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 19 models tracked.

Top models

#ModelScore
1Claude Sonnet 4 (Thinking)66.98
2O4 Mini (High)66.75
3Claude Sonnet 461.02
4Gemini 2.5 Pro58.05
5Grok 455.12
6GPT-4.1 Mini50.87
7Qwen 3 235B A22B (Thinking)49.83
8DeepSeek R1 052849.25
9Gemini 2.5 Flash (Thinking)45.04
10Grok 3 Mini39.58
11DeepSeek V3 (0324)38.04
12Qwen 3 235B A22B34.96
13Kimi K2 (0711)27.14

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-07 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.