MiniMax M3 (Thinking): benchmark results
Provider: MiniMax. Released 2026-06-01. Access: Open.
Unified ELO 1661 ± 1, rank #275 of 3078 rated models, from 77 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - Toxicity - Fairness | 99.44 | Criteria met (%) | 93.8 |
| Nejumi 4 - BFCL - Multi-Turn | 61.11 | Accuracy (%) | 92.6 |
| Nejumi 4 - MT-Bench (Japanese) - Roleplay | 99 | Judge rating (1-10, x10) | 91.5 |
| Nejumi 4 - jaster (2-shot) - JSeM | 82 | Exact match (%) | 91.2 |
| Nejumi 4 - JBBQ (2-shot) - Accuracy | 94 | Accuracy (%) | 89.7 |
| Nejumi 4 - jaster (2-shot) - JaMP | 80 | Exact match (%) | 87.9 |
| Nejumi 4 - jaster (2-shot) - JCoLA (out-of-domain) | 87 | Exact match (%) | 87.5 |
| Nejumi 4 - MT-Bench (Japanese) - Writing | 98 | Judge rating (1-10, x10) | 84.9 |
| Nejumi 4 - jaster (2-shot) - JNLI | 90 | Exact match (%) | 84.9 |
| Nejumi 4 - MT-Bench (Japanese) - Extraction | 96.5 | Judge rating (1-10, x10) | 83.8 |
| Nejumi 4 - jaster (0-shot) - JCoLA (in-domain) | 79 | Exact match (%) | 83.5 |
| Nejumi 4 - HLE (Japanese) - Accuracy | 36.08 | Accuracy (%) | 82.7 |
Interactive version: theaggregate.ai/model?slug=minimax-m3-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.