MIRA-Math: leaderboard

Metric: Final-answer accuracy (%; exact verifier match; zero-shot; 2,310 generated instances from 22 typed families, one hidden atomic fact per instance, request budget 3/6/9 by difficulty, fixed gpt-4o-mini responder, temperature 0, single pass; fraction x100). Source: arxiv.org. Saturation forecast: Around December 2026. 6 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)73.9
2GPT-5.169
3Grok 4.2050.3
4Gemini 2.5 Flash49
5GPT-4o Mini24.8

Interactive version: theaggregate.ai/benchmark?slug=mira-math · How It Works · Data refreshed daily, snapshot 2026-09-29.