IneqMath: leaderboard

Olympiad-level inequality proof benchmark evaluating both final-answer correctness and step-wise reasoning soundness for chat and reasoning LLMs.

Metric: Overall Accuracy (self-reported). Source: benchmarklist.com. Status: saturated. 42 models tracked.

Top models

#ModelScore
1GPT-547
2O3 Pro46
3O337
4GPT-5 Mini30.5
5O4 Mini15.5
6DeepSeek R1 05289.5
7O3 Mini9.5
8Kimi K29
9O18
10DeepSeek V3 (0324)7
11Qwen 3 4B5.5
12Grok 33.5
13GPT-4o3
14Gemini 2.0 Flash3
15Qwen 2.5 7B3

Interactive version: theaggregate.ai/benchmark?slug=ineqmath · How It Works · Data refreshed daily, snapshot 2026-09-05.