Inkling (Max): benchmark results
Provider: Thinking Machines. Released 2026-07-15. Access: Open.
Unified ELO 1640 ± 1, rank #204 of 2032 rated models, from 76 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - jaster (0-shot) - MMLU-ProX (Japanese) | 93 | Exact match (%) | 100 |
| Nejumi 4 - jaster (2-shot) - JSQuAD | 82.28 | Character F1 (x100) | 99.3 |
| Nejumi 4 - M-IFEval (Japanese) | 92.04 | Score (%) | 97.8 |
| Nejumi 4 - MT-Bench (Japanese) - Roleplay | 99.5 | Judge rating (1-10, x10) | 96.7 |
| Nejumi 4 - MT-Bench (Japanese) - Writing | 99 | Judge rating (1-10, x10) | 96.3 |
| Nejumi 4 - jaster (0-shot) - JSICK | 85 | Exact match (%) | 96.3 |
| Nejumi 4 - jaster (2-shot) - JCommonsenseQA | 100 | Exact match (%) | 94.5 |
| Nejumi 4 - MT-Bench (Japanese) - Coding | 100 | Judge rating (1-10, x10) | 91.5 |
| Nejumi 4 - MT-Bench (Japanese) - STEM | 100 | Judge rating (1-10, x10) | 90.4 |
| Nejumi 4 - jaster (2-shot) - JSICK | 84 | Exact match (%) | 89.3 |
| Nejumi 4 - MT-Bench (Japanese) - Math | 100 | Judge rating (1-10, x10) | 89 |
| Nejumi 4 - Toxicity - Violation Categories | 51.59 | Criteria met (%) | 86.4 |
Interactive version: theaggregate.ai/model?slug=inkling-max · How It Works · Data refreshed daily, snapshot 2026-09-26.