AgentDrive - Comparative: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 51 models tracked.

Top models

#ModelScore
1GPT-4o (2024-11-20)95
2Mistral Medium 3.195
3Qwen 3 Max95
4Gemma 3 27B (IT)92.5
5Llama 3.1 70B Instruct92.5
6Gemini 2.5 Flash92.5
7Claude 3.7 Sonnet (Thinking)92.5
8Claude Opus 4.192.5
9GPT-5 Chat92.5
10Qwen 3 235B A22B 250792.5
11GPT-4.1 Mini90
12Llama 3.3 70B Instruct90
13GPT-4.190
14GPT-4.1 Nano87.5
15Grok 4 Fast87.5

Interactive version: theaggregate.ai/benchmark?slug=agentdrive-comparative · How It Works · Data refreshed daily, snapshot 2026-09-19.