WearableQA - Data Reasoning: leaderboard

Metric: Accuracy (%; 10-option multiple choice, chain-of-thought). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)75.4
2Claude Opus 4.657.1
3Gemini 2.5 Pro47.5
4Claude Sonnet 447.1
5GPT-5.445
6Gemma 4 26B A4B33.8
7GPT-4o25.3
8Llama 3.3 70B23.5
9Mistral Small 3.120
10Gemma 3 27B19
11Llama 3.1 8B17.4
12Gemma 3 12B17
13Gemma 3 4B15
14Llama 3.2 3B13.6

Interactive version: theaggregate.ai/benchmark?slug=wearableqa-data-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.