WearableQA - Overall: leaderboard

Metric: Accuracy (%; 10-option multiple choice, chain-of-thought). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)72.9
2Claude Opus 4.660.2
3Claude Sonnet 453.2
4GPT-5.451.2
5Gemini 2.5 Pro50.6
6Gemma 4 26B A4B42.5
7GPT-4o34.7
8Mistral Small 3.129.3
9Llama 3.3 70B29.2
10Gemma 3 27B26.2
11Gemma 3 12B24.6
12Llama 3.1 8B23.8
13Gemma 3 4B19.8
14Llama 3.2 3B19.6

Interactive version: theaggregate.ai/benchmark?slug=wearableqa-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.