MMHBench: leaderboard

Metric: Overall accuracy (%; all 2,184 multiple-choice questions on 268 long-form mental-health-related videos, 64 uniformly sampled frames, zero-shot; higher is better). Source: arxiv.org. Saturation forecast: Around 2029. 21 models tracked.

Top models

#ModelScore
1GPT-5.555.31
2Qwen 3.6 35B A3B54.85
3Qwen 3.5 35B A3B51.74
4Qwen 3.7 Plus51.51
5Qwen 3.5 9B51.42
6Qwen 3.6 Plus49.22
7Qwen 3.5 4B49.13
8Qwen 3 VL 32B46.02
9Gemma 4 26B A4B45.01
10MiniCPM-V-2.637.68
11Ministral 3 14B30.31
12Gemma 4 E4B28.75

Interactive version: theaggregate.ai/benchmark?slug=mmhbench · How It Works · Data refreshed daily, snapshot 2026-09-29.