HarmVideoBench — leaderboard

Metric: Macro Avg. (self-reported). Source: benchmarklist.com. 21 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)82.1
2Gemini 3.1 Flash81.3
3GPT-5.580.9
4Claude Opus 4.780.3
5Qwen 3 VL 235B A22B (Thinking)80.1
6Claude Sonnet 4.679.9
7Qwen 3 VL 235B A22B Instruct79.7
8Qwen 3 VL 32B (Thinking)79.6
9Qwen 3 VL 32B Instruct79
10Qwen 3 VL 30B A3B (Thinking)78.9
11Qwen 3 VL 8B (Thinking)76.7
12Qwen 3 VL 30B A3B Instruct76.3
13LFM2.5-VL-1.6B66.8
14GLM-4.5V65.5
15Qwen 3 VL 8B Instruct61.7

Interactive version: theaggregate.ai/benchmark?slug=harmvideobench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.