SwarmBench - Foraging: leaderboard

Metric: Task score (mean of 5 simulations, higher is better). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1Gemini 2.0 Flash5.8
2O4 Mini4.8
3GPT-4.13.2
4DeepSeek V32.6
5O3 Mini2.6
6GPT-4o1.6
7GPT-4.1 Mini1.4
8Claude 3.7 Sonnet1.2
9DeepSeek R11
10Llama 4 Scout1
11QwQ-32B0.8
12Llama 3.1 70B Instruct0
13Claude 3.5 Haiku0

Interactive version: theaggregate.ai/benchmark?slug=swarmbench-foraging · How It Works · Data refreshed daily, snapshot 2026-09-19.