LLM Public Goods Game: leaderboard

Classic economic cooperation experiment: LLMs decide how many tokens to contribute to a shared pool across 310 multi-player, multi-round games with varying multiplication factors. Measures cooperative vs. self-interested behavior.

Metric: Avg. Contribution (%). Source: github.com. 21 models tracked.

Top models

#ModelScore
1Claude 3.5 Haiku40.97
2Gemma 2 27B31.16
3Gemini 1.5 Flash30.2
4GPT-4o Mini24.82
5Gemini 1.5 Pro (Sept)24.64
6Qwen 2.5 72B23.59
7Claude 3.5 Sonnet (20241022)20.89
8Gemini 2.0 Flash (01-21) (Thinking)20
9Grok 2 (1212)15.83
10DeepSeek V315.5
11GPT-4o14.7
12Llama 3.1 405B3.16
13O1 Mini2.59
14O12.55
15Mistral Large 2 (Jul)1.57

Interactive version: theaggregate.ai/benchmark?slug=llm-public-goods-game · How It Works · Data refreshed daily, snapshot 2026-09-05.