WearableQA - Health Reasoning: leaderboard

Metric: Accuracy (%; 10-option multiple choice, chain-of-thought). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)67.8
2Claude Opus 4.666.3
3Claude Sonnet 465.2
4GPT-5.463.5
5Gemma 4 26B A4B59.8
6Gemini 2.5 Pro56.8
7GPT-4o53.5
8Mistral Small 3.147.9
9Gemma 3 27B40.7
10Llama 3.3 70B40.7
11Gemma 3 12B39.9
12Llama 3.1 8B36.8
13Llama 3.2 3B31.7
14Gemma 3 4B29.4

Interactive version: theaggregate.ai/benchmark?slug=wearableqa-health-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.