WildRoadBench: leaderboard

Metric: AP50 (self-reported). Source: benchmarklist.com. 25 models tracked.

Top models

#ModelScore
1Gemini 3 Pro42.1
2Qwen 3.6 Plus36.8
3Gemini 3.1 Flash Lite25.8
4Claude Sonnet 4.625
5Qwen 2.5 VL 7B Instruct23.6
6Qwen 3 VL 8B Instruct21.3
7GPT-5.420.9
8Gemini 2.5 Flash16.3
9Kimi K2.516.1
10Qwen 3 VL 8B (Thinking)14.8
11Claude Opus 4.612.7
12InternVL3-8B10.9
13GPT-4o9.5
14InternVL2-8B2.2

Interactive version: theaggregate.ai/benchmark?slug=wildroadbench · How It Works · Data refreshed daily, snapshot 2026-09-05.