LLM2014 Code 2025-11 - Java — leaderboard

Metric: Score. Source: raw.githubusercontent.com. 26 models tracked.

Top models

#ModelScore
1Gemini 3 Pro9.67
2Claude Sonnet 4.5 (Thinking)9.22
3GPT-5 Mini (High)9.2
4Claude Opus 4.58.58
5Qwen 3 Max8.08
6DeepSeek V3.27.75
7Claude Sonnet 4.57.33
8GLM-4.6 (Thinking)6.87
9Gemini 2.5 Pro6.35
10DeepSeek V3.2 (Thinking)6.25
11Kimi K2 (Thinking)5.83
12GLM-4.64.77
13MiniMax-M24.7
14Claude Haiku 4.54.5
15Kimi K2 09054.25

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-11-java · How the rankings work · Data refreshed daily, snapshot 2026-07-22.