UAV-DualCog - Landmark-Relative Direction: leaderboard

Metric: Answer accuracy (%; 1,024 questions asking where a landmark lies relative to the UAV forward direction; structured JSON answers on renders of simulated AerialVLN scenes, the discrete answer scored whatever the predicted box or interval; instant mode with explicit thinking disabled where a model allows it; higher is better). Source: arxiv.org. Saturation forecast: Around 2028. 36 models tracked.

Top models

#ModelScore
1GPT-5.5 (Non-reasoning)65.4
2Qwen 3.5 27B (Non-reasoning)57.8
3GPT-5.3 Instant56.5
4Qwen 3.7 Plus (Non-reasoning)55.4
5Qwen 3.5 9B (Non-reasoning)53.2
6Qwen 3.5 35B A3B (Non-reasoning)53.2
7Qwen 3.5 122B A10B (Non-reasoning)49.7
8Claude Sonnet 4.648.5
9Qwen 3.6 Plus (Non-reasoning)48.4
10Qwen 3.5 397B A17B (Non-reasoning)47.9
11Qwen 3.5 Plus (Non-reasoning)47.6
12Gemini 3.1 Flash Lite (Non-reasoning)47.6
13Qwen 3.5 4B (Non-reasoning)47.5
14Kimi K2.6 (Non-reasoning)42.8
15Kimi K2.5 (Non-reasoning)39.4

Interactive version: theaggregate.ai/benchmark?slug=uav-dualcog-landmark-relative-direction · How It Works · Data refreshed daily, snapshot 2026-09-29.