OlympicArena — leaderboard

Metric: Overall Accuracy (%). Source: gair-nlp.github.io. 28 models tracked.

Top models

#ModelScore
1GPT-4o34.01
2Claude 3.5 Sonnet33.54
3DeepSeek Coder V229.31
4Qwen 2 72B Instruct28.84
5Gemini 1.5 Pro28.68
6GPT-4o Mini28.37
7Llama 3 70B Instruct21.63
8Qwen 1.5 32B Chat21.16
9Gemma 2 27B (IT)19.91
10Claude 3 Sonnet18.97
11internlm2.5-7B-chat18.65
12Llama 3.1 8B Instruct14.73
13InternVL2-8B14.73
14internlm2-chat-20B13.95
15Yi 34B (Chat)12.54

Interactive version: theaggregate.ai/benchmark?slug=olympicarena · How the rankings work · Data refreshed daily, snapshot 2026-07-22.