MathArena - Kangaroo 2025 Levels 3-4 — leaderboard

Metric: Accuracy (%). Source: matharena.ai. 21 models tracked.

Top models

#ModelScore
1Human Expert100
2GPT-5.5 (xHigh)89.58
3GPT-5.4 (xHigh)83.33
4Gemini 3.1 Pro (Preview)76.04
5GPT-5.2 (High)73.96
6Gemini 3.5 Flash72.92
7Qwen 3.5 397B A17B68.75
8Gemini 3 Pro (Preview)66.67
9GPT-5 Mini (High)66.67
10Gemini 3 Flash66.67
11GPT-5.1 (High)65.62
12Kimi K2.5 (Thinking)65.62
13Median Human65
14Gemini 2.5 Pro64.58
15Claude Sonnet 4.5 (Thinking)62.5

Interactive version: theaggregate.ai/benchmark?slug=matharena-kangaroo-2025-levels-3-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.