MiniMax-M3: benchmark results

MiniMax M3 model for reasoning and agentic tasks. Provider: MiniMax. Released 2026-06-01. Access: Open.

Unified ELO 1649 ± 1, rank #131 of 1392 rated models, from 335 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LLM Stats (OmniDocBench 1.5)91.6Score (%)100
AA IFBench82.86Accuracy (%)99.6
AA-LCR80.33Accuracy (self-reported)97.6
AA Long Context Reasoning83Accuracy (%)97
AA GPQA Diamond92.93Accuracy (%)95.8
OpenClawProBench75.1Overall Score (%)93.9
Nejumi 4 - GLP - Expression98.83Score (%)93
OpenRouter GPQA Diamond90.5Accuracy (%)92.9
Nejumi 4 - GLP - Logical Reasoning94.5Score (%)92.6
Vals AI CorpFin v268.1Accuracy (%)92.5
Nejumi 4 - ALT - Toxicity85.62Score (%)91
Nejumi 4 - MT-Bench (Japanese)97.62Score (%)90.2

Interactive version: theaggregate.ai/model?slug=minimax-m3 · How It Works · Data refreshed daily, snapshot 2026-09-05.