ZeroEval MATH-500 — leaderboard
Allen AI ZeroEval evaluation of MATH-500: competition-level math problems, scored independently from Artificial Analysis.
Metric: MATH-500 Score. Source: www.vals.ai. Status: saturated. 32 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Sarvam 105B | 98.6 |
| 2 | GLM-4.5 | 98.2 |
| 3 | GLM 4.5 Air | 98.1 |
| 4 | NVIDIA Nemotron Nano 9B V2 | 97.8 |
| 5 | Kimi K2 | 97.4 |
| 6 | Kimi K2 0905 | 97.4 |
| 7 | Llama 3.1 Nemotron Ultra 253B v1 | 97 |
| 8 | Sarvam 30B | 97 |
| 9 | MiniMax M1 80k | 96.8 |
| 10 | LongCat Flash Lite | 96.8 |
| 11 | LongCat-Flash-Chat | 96.4 |
| 12 | Claude 3.7 Sonnet | 96.2 |
| 13 | MiniMax M1 40k | 96 |
| 14 | Phi-4-mini (Reasoning) | 94.6 |
| 15 | DeepSeek R1 Distill Llama 70B | 94.5 |
Interactive version: theaggregate.ai/benchmark?slug=zeroeval-math-500 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.