WildRoadBench — leaderboard

Metric: AP50 (self-reported). Source: benchmarklist.com. 25 models tracked.

Top models

#ModelScore
1Qwen 3.6 Plus36.8
2Gemini 3.1 Flash Lite25.8
3Claude Sonnet 4.625
4Qwen 2.5 VL 7B Instruct23.6
5Qwen 3 VL 8B Instruct21.3
6GPT-5.420.9
7Gemini 2.5 Flash16.3
8Qwen 3 VL 8B (Thinking)14.8
9Claude Opus 4.612.7
10InternVL3-8B10.9
11GPT-4o9.5
12InternVL3-14B7.9
13InternVL2-8B2.2

Interactive version: theaggregate.ai/benchmark?slug=wildroadbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.