HarmVideoBench: leaderboard

Metric: Macro Avg. (self-reported). Source: benchmarklist.com. 21 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)82.1
2Gemini 3.1 Flash81.3
3GPT-5.580.9
4Claude Opus 4.780.3
5Qwen 3 VL 235B A22B (Thinking)80.1
6Claude Sonnet 4.679.9
7Qwen 3 VL 235B A22B Instruct79.7
8Qwen 3 VL 32B (Thinking)79.6
9Qwen 3 VL 32B Instruct79
10Qwen 3 VL 30B A3B (Thinking)78.9
11Qwen 3 VL 8B (Thinking)76.7
12Qwen 3 VL 30B A3B Instruct76.3
13Kimi K2.571.2
14LFM2.5-VL-1.6B66.8
15GLM-4.5V65.5

Interactive version: theaggregate.ai/benchmark?slug=harmvideobench · How It Works · Data refreshed daily, snapshot 2026-09-05.