Kimi K2 (0905) (Thinking) — benchmark results

Provider: Moonshot. Released 2025-07-11. Access: Open.

Unified ELO 1725 ± 35, rank #273 of 1806 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OJBench48.7Score (self-reported)97.7
MathArena - HMMT Feb 202597.5Accuracy (%)91.7
LLM Stats (HMMT 2025)97.5Score (%)90.6
LLM Stats (HealthBench)58Score (%)87.5
LLM Stats (OJBench)48.7Score (%)87.5
LLM Stats (MMLU-Redux)94.4Score (%)86.3
LLM Stats Score36.78LLM Stats Score (conservative rating)82.7
LLM Stats (Seal-0)56.3Score (%)80
ZeroEval GPQA Diamond84.5GPQA Diamond Score74.9
WritingBench73.8Score (self-reported)47.7
LLM Stats (BrowseComp-zh)62.3Score (%)41.7
LLM Stats (Multi-SWE-Bench)41.9Score (%)40

Interactive version: theaggregate.ai/model?slug=kimi-k2-0905-thinking · How It Works · Data refreshed daily, snapshot 2026-08-07.