Kimi K2: benchmark results

Moonshot Kimi K2 open 1T-parameter MoE model (32B active). Provider: Moonshot. Released 2025-07-11. Access: Open.

Unified ELO 1633 ± 1, rank #171 of 1392 rated models, from 485 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Capabilities - WildBench86.19WB Score100
MLB77.29Average (self-reported)100
SciEval - Earth Sciences77.77Earth Sciences (%)100
SuiChat-CN76.3Standard F1 (self-reported)100
UGI Leaderboard56.55UGI Score97.4
HELM Capabilities - Omni-MATH65.4Acc96
WritingBench81.26Score (self-reported)94.4
ProLLM - Summarization95.9Score (%)94
HELM Safety97.9Mean score (self-reported)93
Galileo Agent - Banking Accuracy58Accuracy (%)92.9
ProLLM - OpenBook Q&A86.3Score (%)92.4
AA Omniscience - Software Engineering (SWE) - Swift56Accuracy (%)91.5

Interactive version: theaggregate.ai/model?slug=kimi-k2 · How It Works · Data refreshed daily, snapshot 2026-09-05.