FitAQA - Perception: leaderboard

Metric: Question-macro accuracy (%; recognizing the quality-relevant visual manifestation, equal weight per unique question; over FitAQA's fitness action-quality videos (30 bodyweight exercises, 38-error taxonomy); perception task). Source: arxiv.org. Saturation forecast: Around 2030. 15 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)54.3
2GPT-5.554.1
3GPT-5.451.3
4Gemma 4 31B46.3
5Qwen 3.5 35B A3B (Thinking)45.9
6Qwen 3.5 27B (Thinking)45.7
7Qwen 3.5 35B A3B (Non-reasoning)45.6
8Qwen 3.5 27B (Non-reasoning)45.2
9Qwen 3.5 9B (Non-reasoning)44.6
10Qwen 3 VL 8B44.2
11Qwen 3.5 9B (Thinking)43.9

Interactive version: theaggregate.ai/benchmark?slug=fitaqa-perception · How It Works · Data refreshed daily, snapshot 2026-09-26.