SwarmBench - Flocking: leaderboard

Metric: Task score (mean of 5 simulations, higher is better). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1O4 Mini17.8
2DeepSeek V315
3Llama 4 Scout14.8
4GPT-4o14.6
5Llama 3.1 70B Instruct13.8
6Claude 3.7 Sonnet13.6
7GPT-4.113.4
8O3 Mini13.4
9GPT-4.1 Mini12.2
10Gemini 2.0 Flash10.4
11DeepSeek R18.4
12QwQ-32B7
13Claude 3.5 Haiku3.6

Interactive version: theaggregate.ai/benchmark?slug=swarmbench-flocking · How It Works · Data refreshed daily, snapshot 2026-09-19.