DisasterBench (UAV) - Cascading Risk Reasoning: leaderboard

Metric: Accuracy (%) on cascading risk reasoning (CRR) questions on the 3,000-question test split of low-altitude UAV disaster images (14 disaster scene types), multiple choice scored by strict exact match on the final option letter; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 21 models tracked.

Top models

#ModelScore
1Gemini 2.0 Flash81.45
2Gemini 2.5 Pro80.32
3GPT-580.09
4Claude Sonnet 4.576.02
5InternVL2-8B72.4
6GPT-4o71.95
7Gemini 2.5 Flash71.04
8Qwen 2.5 VL 7B Instruct70.14
9Grok 469.68
10GPT-4o Mini62.44
11InternVL3.5-8B51.36

Interactive version: theaggregate.ai/benchmark?slug=disasterbench-uav-cascading-risk-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-29.