SwarmBench - Pursuit: leaderboard

Metric: Task score (mean of 5 simulations, higher is better). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1O4 Mini9.6
2Gemini 2.0 Flash8.8
3GPT-4.18.4
4Claude 3.7 Sonnet4.4
5DeepSeek V34.2
6O3 Mini3.6
7GPT-4o3.4
8QwQ-32B2.2
9Llama 3.1 70B Instruct1.8
10GPT-4.1 Mini1.4
11Llama 4 Scout1.2
12DeepSeek R11
13Claude 3.5 Haiku0.6

Interactive version: theaggregate.ai/benchmark?slug=swarmbench-pursuit · How It Works · Data refreshed daily, snapshot 2026-09-19.