gwBenchmarks: leaderboard

Metric: Waveform (self-reported). Source: benchmarklist.com. 12 models tracked.

Top models

#ModelScore
1Claude Haiku 4.559.31
2DeepSeek V4 Pro48.3
3Kimi K2.639.12
4GPT-5.4 Mini35.97
5Gemini 3.1 Pro (Preview)34.25
6Gemini 3 Flash21.27
7GPT-5.219.35
8GPT-5.5 (High)17.82
9GPT-5.3 Codex17.82
10Claude Opus 4.716.48
11Claude Opus 4.614.75
12Claude Sonnet 4.614.22

Interactive version: theaggregate.ai/benchmark?slug=gwbenchmarks · How It Works · Data refreshed daily, snapshot 2026-09-05.