BehaviorBench - Economics Olympiad: leaderboard

Metric: Accuracy (%) on 124 four-option multiple-choice International Economics Olympiad problems from 2018 to 2025, mean of five runs; chance 25; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 18 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)95.6
2Claude Opus 4.695.6
3GPT-5.4 (High)95.6
4GPT-5.4 Mini (High)93.2
5Claude Sonnet 4.683.1
6GPT-4.178.4
7Gemini 3.1 Flash Lite (Preview)77.6
8DeepSeek V3.274.4
9Qwen 3 4B73.9
10Claude Haiku 4.570
11Llama 3.3 70B Instruct65.8

Interactive version: theaggregate.ai/benchmark?slug=behaviorbench-economics-olympiad · How It Works · Data refreshed daily, snapshot 2026-09-29.