InfraBench - Mean Effective Score: leaderboard

Metric: Difficulty-weighted mean effective score (0-100; mean of three attempts). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1Claude Code + Claude Fable 589.2
2Cursor CLI + Grok 4.584.3
3Claude Code + Claude Opus 583.1
4Qoder CLI + Qwen3.8 Max81.4
5Claude Code + Claude Opus 4.880.2
6Qoder CLI + Kimi K377.3
7Claude Code + Claude Sonnet 577.2
8Gemini CLI + Gemini 3.6 Flash75.5
9Qoder CLI + GLM 5.274
10Cursor CLI + Composer 2.572.6

Interactive version: theaggregate.ai/benchmark?slug=infrabench-mean-effective-score · How It Works · Data refreshed daily, snapshot 2026-09-19.