LLM2014 Code 2025-09 - Golang — leaderboard

Metric: Score. Source: raw.githubusercontent.com. 20 models tracked.

Top models

#ModelScore
1GPT-5 Mini (High)8.4
2O4 Mini (High)7.35
3Claude Sonnet 4 (Thinking)6.11
4DeepSeek V3.1 (Thinking)5.17
5GPT-OSS-120B (High)5.12
6Claude Sonnet 45.01
7DeepSeek V3.14.62
8Qwen 3 235B A22B 2507 Instruct4.27
9Gemini 2.5 Pro4.11
10Grok 44.06
11GLM-4.5 (Thinking)3.79
12GPT-OSS-20B (High)3.59
13GLM-4.53.54
14Gemini 2.5 Flash (Thinking)2.88
15Kimi K2 (0711)2.44

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-09-golang · How the rankings work · Data refreshed daily, snapshot 2026-07-22.