MiniMax M3 (Thinking): benchmark results

Provider: MiniMax. Released 2026-06-01. Access: Open.

Unified ELO 1661 ± 1, rank #275 of 3078 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - Toxicity - Fairness99.44Criteria met (%)93.8
Nejumi 4 - BFCL - Multi-Turn61.11Accuracy (%)92.6
Nejumi 4 - MT-Bench (Japanese) - Roleplay99Judge rating (1-10, x10)91.5
Nejumi 4 - jaster (2-shot) - JSeM82Exact match (%)91.2
Nejumi 4 - JBBQ (2-shot) - Accuracy94Accuracy (%)89.7
Nejumi 4 - jaster (2-shot) - JaMP80Exact match (%)87.9
Nejumi 4 - jaster (2-shot) - JCoLA (out-of-domain)87Exact match (%)87.5
Nejumi 4 - MT-Bench (Japanese) - Writing98Judge rating (1-10, x10)84.9
Nejumi 4 - jaster (2-shot) - JNLI90Exact match (%)84.9
Nejumi 4 - MT-Bench (Japanese) - Extraction96.5Judge rating (1-10, x10)83.8
Nejumi 4 - jaster (0-shot) - JCoLA (in-domain)79Exact match (%)83.5
Nejumi 4 - HLE (Japanese) - Accuracy36.08Accuracy (%)82.7

Interactive version: theaggregate.ai/model?slug=minimax-m3-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.