LLM2014 Code 2025-09 - C# — leaderboard

Metric: Score. Source: raw.githubusercontent.com. 20 models tracked.

Top models

#ModelScore
1DeepSeek V3.1 (Thinking)8.7
2O4 Mini (High)8.65
3Claude Sonnet 4 (Thinking)8.31
4GPT-5 Mini (High)8.18
5Gemini 2.5 Flash (Thinking)7.98
6Claude Sonnet 47.91
7Gemini 2.5 Pro7.15
8GLM-4.5 (Thinking)6.94
9Grok 46.8
10GPT-OSS-120B (High)6.27
11DeepSeek V3.16.2
12GPT-OSS-20B (High)5.89
13Qwen 3 235B A22B 2507 Instruct5.7
14Kimi K2 (0711)5.28
15GLM-4.55.01

Interactive version: theaggregate.ai/benchmark?slug=llm2014-code-2025-09-c · How the rankings work · Data refreshed daily, snapshot 2026-07-22.