AtmosCoder-Bench: leaderboard

Metric: Accuracy (%, mean of 3 runs). Source: github.com. 16 models tracked.

Top models

#ModelScore
1GPT-5.597.6
2Gemini 3.1 Pro (Preview) (Thinking)96
3Kimi K2.6 (Thinking)93.8
4DeepSeek V4 Pro (Reasoning)93.3
5DeepSeek V4 Flash (Reasoning)91.1
6GPT-5.5 (Non-reasoning)90.8
7Kimi K2.6 (Non-reasoning)90.1
8Qwen 3.6 27B (Reasoning)88.5
9DeepSeek V4 Pro (Non-reasoning)82.6
10DeepSeek V4 Flash (Non-reasoning)81.7
11Qwen 3.6 27B (Non-reasoning)79.4
12Qwen 3.5 9B (Reasoning)76.9
13Qwen 3.5 9B (Non-reasoning)63.4

Interactive version: theaggregate.ai/benchmark?slug=atmoscoder-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.