PushupBench: leaderboard

Metric: Exact match (%): share of clips whose predicted repetition count equals the ground truth, on PushupBench's 446 long-form exercise clips (22-117 s, 11 creators in 10 countries; 27 clips accept several valid counts) sampled at 5 fps up to 112 frames (Claude models capped at 100 frames by the API), 360p frames, greedy decoding, 10 prompt templates; higher is better. Source: arxiv.org. Saturation forecast: Around June 2027. 20 models tracked.

Top models

#ModelScore
1Gemini 3 Flash42.1
2Gemini 3 Pro39.8
3Gemini 2.5 Pro29.9
4Qwen 3 VL 32B Instruct11.8
5GPT-510.9
6Gemini 2.5 Flash10.9
7Qwen 3 VL 32B (Thinking)9.9
8Qwen 3 VL 30B A3B (Thinking)9.6
9Claude Sonnet 4.59.5
10Qwen 2.5 VL 7B9.2
11Gemini 2.0 Flash8.9
12Qwen 3 VL 4B Instruct8.9
13Qwen 3 VL 235B A22B Instruct8.6
14Qwen 3 VL 4B (Thinking)8.2
15Qwen 3 VL 30B A3B Instruct7.6

Interactive version: theaggregate.ai/benchmark?slug=pushupbench · How It Works · Data refreshed daily, snapshot 2026-10-07.