MiniMax-M3: benchmark results
MiniMax M3 model for reasoning and agentic tasks. Provider: MiniMax. Released 2026-06-01. Access: Open.
Unified ELO 1649 ± 1, rank #131 of 1392 rated models, from 335 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| LLM Stats (OmniDocBench 1.5) | 91.6 | Score (%) | 100 |
| AA IFBench | 82.86 | Accuracy (%) | 99.6 |
| AA-LCR | 80.33 | Accuracy (self-reported) | 97.6 |
| AA Long Context Reasoning | 83 | Accuracy (%) | 97 |
| AA GPQA Diamond | 92.93 | Accuracy (%) | 95.8 |
| OpenClawProBench | 75.1 | Overall Score (%) | 93.9 |
| Nejumi 4 - GLP - Expression | 98.83 | Score (%) | 93 |
| OpenRouter GPQA Diamond | 90.5 | Accuracy (%) | 92.9 |
| Nejumi 4 - GLP - Logical Reasoning | 94.5 | Score (%) | 92.6 |
| Vals AI CorpFin v2 | 68.1 | Accuracy (%) | 92.5 |
| Nejumi 4 - ALT - Toxicity | 85.62 | Score (%) | 91 |
| Nejumi 4 - MT-Bench (Japanese) | 97.62 | Score (%) | 90.2 |
Interactive version: theaggregate.ai/model?slug=minimax-m3 · How It Works · Data refreshed daily, snapshot 2026-09-05.