FrontierCode: leaderboard

Cognition benchmark for production-quality coding agents measuring whether maintainers would merge model PRs. It uses 150 maintainer-authored open source tasks with nested Extended, Main, and Diamond subsets scored by blockers and quality rubrics.

Metric: Score (%). Source: cognition.ai. Status: years away from saturation. 12 models tracked.

Top models

#ModelScore
1Claude Opus 4.813.4
2GPT-5.56.3
3Claude Opus 4.75.2
4Gemini 3.1 Pro (Preview)4.7
5GPT-5.4 Mini4.6
6Kimi K2.63.8
7Claude Sonnet 4.63.5
8MiniMax-M2.72.4
9MiniMax-M2.51.1
10Kimi K2.51
11Gemini 3.1 Flash Lite0.7

Interactive version: theaggregate.ai/benchmark?slug=frontiercode · How It Works · Data refreshed daily, snapshot 2026-09-05.