InferenceBench: leaderboard

Benchmark for coding agents optimizing inference workloads. Agents tune serving configurations and implementation choices across latency, throughput, and all-in-one scenarios.

Metric: Speedup Score. Source: inferencebench.ai. Status: years away from saturation. 32 models tracked.

Top models

#ModelScore
1Claude Opus 58.9
2Claude Fable 5 (Low)8.74
3Claude Opus 4.78.53
4Claude Opus 4.87.6
5Claude Fable 57.52
6Claude Opus 4.8 (xHigh)7.34
7GLM-5.2 (Max)7
8Grok 4.66.65
9Claude Sonnet 56.43
10Kimi K2.7 Code6.27
11GPT-5.4 (High)6.16
12Kimi K35.7
13Claude Sonnet 4.65.56
14GPT-5.3 Codex (High)5.49
15GPT-5.5 (xHigh)5.45

Interactive version: theaggregate.ai/benchmark?slug=inferencebench · How It Works · Data refreshed daily, snapshot 2026-09-05.