Uruqi: leaderboard

Metric: Overall accuracy (%): mean of the three stage scores (self-motion, object mapping, state operations), subclasses weighted equally within each stage, over 52k questions on 2.7k simulated camera-trajectory episodes; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 12 models tracked.

Top models

#ModelScore
1GPT-6 Astra50.08
2Gemini 3.1 Pro (Preview)27.37
3GPT-5.524.5
4Qwen 3.8 Max23.58
5Qwen 3.8 27B16.94
6InternVL3-8B15.84

Interactive version: theaggregate.ai/benchmark?slug=uruqi · How It Works · Data refreshed daily, snapshot 2026-10-02.