Kimi K2 (Thinking): benchmark results

Kimi K2 evaluated with thinking enabled. Provider: Moonshot. Released 2025-11-06. Access: Open.

Unified ELO 1586 ± 1, rank #488 of 1761 rated models, from 272 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CLEM Wordle73Game Clemscore (%)100
AA AIME 202594.67Accuracy (%)97.2
AA LiveCodeBench85.29Pass@1 (%)96.7
CLEM TextMapWorld GraphReasoning84.28Game Clemscore (%)96.2
AA Omniscience - Software Engineering (SWE) - Kotlin46Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - Dart40Accuracy (%)94.5
UGI Leaderboard52.68UGI Score94
UGI - Writing59.28Writing Score92.6
AI for Education Pedagogy - Technology86.79Accuracy (%)92.4
AA Omniscience - Software Engineering (SWE) - C63Accuracy (%)92
AA Omniscience - Software Engineering (SWE) - TypeScript47.78Accuracy (%)92
UGI - Natural Intelligence54.36NatInt Score91.6

Interactive version: theaggregate.ai/model?slug=kimi-k2-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.