NuminaMath-7B-CoT: benchmark results
Provider: Other. Released 2024-07-15. Access: Open.
Unified ELO 1342 ± 1, rank #1283 of 1392 rated models, from 8 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MATH Level 5 | 26.96 | Score | 79.4 |
| Open LLM Leaderboard - MMLU-Pro | 20.76 | Score | 32.6 |
| Open LLM Leaderboard - BBH | 19.15 | Score | 28.7 |
| Open LLM Leaderboard - IFEval | 26.89 | Score | 23.9 |
| Open Korean LLM Leaderboard | 32.02 | Average Score (%) | 21.9 |
| Open LLM Leaderboard - GPQA | 2.13 | Score | 20.3 |
| MATH-Perturb (Hard) | 17.2 | Accuracy (%) | 19.4 |
| Open LLM Leaderboard - MuSR | 0.83 | Score | 1.1 |
Interactive version: theaggregate.ai/model?slug=numinamath-7b-cot · How It Works · Data refreshed daily, snapshot 2026-09-05.