Physical AI Bench - Understanding Overall — leaderboard

Metric: Overall Score (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1GPT-569.8
2Qwen 3 VL 235B A22B Instruct64.7
3Qwen 3 VL 235B A22B (Thinking)63.7
4Qwen 3 VL 32B Instruct62
5Qwen 3 VL 32B (Thinking)61
6Qwen 3 VL 30B A3B Instruct59.5
7GLM-4.5V59.2
8Qwen 3 VL 30B A3B (Thinking)57.3
9Qwen 3 VL 8B (Thinking)57.3
10Qwen 3 VL 8B Instruct56.8
11GPT-4o56.2
12Qwen 2.5 VL 32B Instruct55.3
13Qwen 2.5 VL 7B Instruct51
14InternVL3.5-8B49.7
15Claude 3.5 Sonnet46

Interactive version: theaggregate.ai/benchmark?slug=physical-ai-bench-understanding-overall · How the rankings work · Data refreshed daily, snapshot 2026-07-22.