IMO-AnswerBench: leaderboard

International Mathematical Olympiad answer benchmark evaluating final-answer correctness on high-difficulty olympiad-style mathematical problems.

Metric: Score (%). Source: llm-stats.com. Status: years away from saturation. 20 models tracked.

Top models

#ModelScore
1Nemotron 3 Ultra92.3
2GLM-5.291
3Qwen 3.7 Max90
4Hy390
5DeepSeek V4 Pro (Max)89.8
6DeepSeek V4 Flash (Max)88.4
7Kimi K2.686
8Qwen 3.7 Plus86
9Step 3.5 Flash85.4
10DeepSeek V4 Flash (0423)85.1
11Qwen 3.6 Plus83.8
12GLM-5.183.8
13GLM-4.782
14Kimi K2.581.8
15Qwen 3.5 397B A17B80.9

Interactive version: theaggregate.ai/benchmark?slug=imo-answerbench · How It Works · Data refreshed daily, snapshot 2026-09-05.