MIRA-Math (Four-shot): leaderboard

Metric: Final-answer accuracy (%; exact verifier match; four-shot prompt with examples of valid minimal requests; 2,310 generated instances from 22 typed families, one hidden atomic fact per instance, request budget 3/6/9 by difficulty, fixed gpt-4o-mini responder, temperature 0, single pass; fraction x100). Source: arxiv.org. Saturation forecast: Around December 2026. 6 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)71
2GPT-5.168.7
3Grok 4.2048.3
4Gemini 2.5 Flash32.8
5GPT-4o Mini23.3

Interactive version: theaggregate.ai/benchmark?slug=mira-math-four-shot · How It Works · Data refreshed daily, snapshot 2026-09-29.