LLM2014 Code 2025-09 - C++ — leaderboard

Metric: Score. Source: raw.githubusercontent.com. 20 models tracked.

Top models

#ModelScore
1GPT-5 Mini (High)7.29
2DeepSeek V3.1 (Thinking)6.19
3O4 Mini (High)6.04
4GLM-4.5 (Thinking)5.62
5Qwen 3 235B A22B 2507 Instruct5.08
6GPT-OSS-120B (High)4.87
7Grok Code Fast 14.66
8Kimi K2 (0711)4.65
9GLM-4.54.55
10Gemini 2.5 Pro4.51
11Claude Sonnet 4 (Thinking)4.44
12GPT-OSS-20B (High)4.34
13Claude Sonnet 43.88
14DeepSeek V3.13.41
15Grok 42.43

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-09-c-plus-plus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.