GSO-Bench — leaderboard

102 software optimization challenges across 10 codebases in 5 languages. Models must improve runtime efficiency to match expert developers. Includes hack detection to prevent deceptive optimizations.

Metric: Opt@1 (%). Source: gso-bench.github.io. Status: saturation imminent. 30 models tracked.

Top models

#ModelScore
1Claude Opus 4.847.06
2Claude Opus 4.744.12
3Claude Opus 4.641.18
4GPT-5.540.2
5Claude Sonnet 537.25
6GPT-5.431.37
7GPT-5.227.45
8Claude Opus 4.526.47
9Gemini 3.1 Pro (Preview)22.55
10Gemini 3 Pro18.63
11Claude Sonnet 4.514.71
12GPT-5.113.73
13O4 Mini12.7
14Gemini 3 Flash9.8
15O38.82

Interactive version: theaggregate.ai/benchmark?slug=gso-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.