Convex Coding Evals — No Guidelines (111 tasks): leaderboard

Metric: Pass rate (%). Source: benchmarklist.com. 30 models tracked.

Top models

#ModelScore
1GPT-684.68
2Claude Fable 583.78
3Claude Opus 581.68
4GPT-5.6 Sol81.53
5Claude Fable 5.181.08
6Claude Opus 4.880.63
7Grok 4.676.83
8Claude Sonnet 573.87
9Grok 4.572.97
10Claude Sonnet 4.670.37
11Hy4 preview69.97
12GPT-5.6 Terra69.82
13GPT-5.569.37
14Gemini 3.7 Flash68.65
15Kimi K365.77

Interactive version: theaggregate.ai/benchmark?slug=convex-coding-evals-no-guidelines-111-tasks · How It Works · Data refreshed daily, snapshot 2026-09-19.