InferenceBench — leaderboard

Benchmark for coding agents optimizing inference workloads. Agents tune serving configurations and implementation choices across latency, throughput, and all-in-one scenarios.

Metric: Speedup Score. Source: inferencebench.ai. Status: saturation imminent. 23 models tracked.

Top models

#ModelScore
1Claude Opus 4.78.53
2Claude Opus 4.87.6
3Claude Fable 57.52
4Claude Opus 4.8 (xHigh)7.34
5GLM-5.2 (Max)7
6GPT-5.4 (High)6.16
7Claude Sonnet 4.65.56
8GPT-5.3 Codex (High)5.49
9GPT-5.5 (xHigh)5.45
10Gemini 3.1 Pro (Preview)4.92
11Kimi K2.64.51
12Claude Opus 4.64.38
13GPT-5.24.28
14GPT-5.5 (High)4.22
15Gemini 3.5 Flash4.16

Interactive version: theaggregate.ai/benchmark?slug=inferencebench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.