CAVSR: leaderboard

Metric: Micro-F1 (%; multi-label child-risk recognition over 26 fine-grained risk labels on 605 expert-annotated AI-generated videos from TikTok, RedNote and YouTube; the model reviews each video directly). Source: arxiv.org. Saturation forecast: Around December 2026. 9 models tracked.

Top models

#ModelScore
1Gemini 3 Flash50.12
2GPT-4o38.98
3Qwen 2.5 VL 7B Instruct12.46
4Qwen 2 VL 7B10.28
5Qwen 2 VL 2B5.46

Interactive version: theaggregate.ai/benchmark?slug=cavsr · How It Works · Data refreshed daily, snapshot 2026-09-29.