LLM2014 Code 2025-09 - Java — leaderboard

Metric: Score. Source: raw.githubusercontent.com. 20 models tracked.

Top models

#ModelScore
1GPT-5 Mini (High)9
2O4 Mini (High)7.89
3Claude Sonnet 4 (Thinking)7.13
4Gemini 2.5 Flash (Thinking)6.97
5Gemini 2.5 Pro6.49
6Grok 46.22
7Claude Sonnet 45.57
8Kimi K2 (0711)5.1
9DeepSeek V3.1 (Thinking)5.01
10GPT-OSS-120B (High)4.87
11Grok Code Fast 14.75
12Qwen 3 235B A22B 2507 Instruct4.32
13GPT-OSS-20B (High)3.92
14DeepSeek V3.13.73
15GLM-4.5 (Thinking)3.07

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-09-java · How the rankings work · Data refreshed daily, snapshot 2026-07-22.