Kimi K3 (Thinking): benchmark results

Provider: Moonshot. Released 2026-07-16. Access: Open.

Unified ELO 1732 ± 1, rank #64 of 3078 rated models, from 86 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - jaster (2-shot) - JaMP85Exact match (%)99.3
Nejumi 4 - MT-Bench (Japanese) - Writing99.5Judge rating (1-10, x10)98.9
Nejumi 4 - jaster (0-shot) - MMLU-ProX (Japanese)91Exact match (%)97.8
MathArena - Kangaroo 2025 Levels 7-896.67Accuracy (%)97.6
Nejumi 4 - jaster (2-shot) - MMLU-ProX (Japanese)91Exact match (%)97.1
Wolfram LLM Benchmarking Project68.8Correct Functionality (%)97.1
Nejumi 4 - jaster (0-shot) - JMMLU96Exact match (%)96.7
MathArena - APEX Shortlist 202592.02Accuracy (%)95.9
Nejumi 4 - HalluLens100Hallucination resistance (%)95.6
Nejumi 4 - HLE (Japanese) - Accuracy44.33Accuracy (%)94.1
ProfBench57.9Overall Rubric Score (%)94.1
Nejumi 4 - Toxicity - Fairness99.44Criteria met (%)93.8

Interactive version: theaggregate.ai/model?slug=kimi-k3-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.