gwBenchmarks — leaderboard

Metric: Waveform (self-reported). Source: benchmarklist.com. 12 models tracked.

Top models

#ModelScore
1Claude Haiku 4.559.3
2DeepSeek V4 Pro48.3
3GPT-5.4 Mini36
4Gemini 3.1 Pro (Preview)34.3
5Gemini 3 Flash (Preview)21.3
6GPT-5.219.4
7GPT-5.5 (High)17.8
8GPT-5.3 Codex17.8
9Claude Opus 4.716.5
10Claude Opus 4.614.7
11Claude Sonnet 4.614.2

Interactive version: theaggregate.ai/benchmark?slug=gwbenchmarks · How the rankings work · Data refreshed daily, snapshot 2026-07-22.