Kimi K2 (Thinking) — benchmark results

Kimi K2 evaluated with thinking enabled. Provider: Moonshot. Released 2025-11-06. Access: Open.

Unified ELO 1721 ± 11, rank #238 of 1776 rated models, from 236 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CLEM Wordle73Game Clemscore (%)100
AA LiveCodeBench85.29Pass@1 (%)96.2
CLEM TextMapWorld GraphReasoning84.28Game Clemscore (%)96.2
AA AIME 202594.67Accuracy (%)96.1
UGI Leaderboard52.68UGI Score94.1
UGI - Writing59.28Writing Score93.3
AI for Education Pedagogy - Technology86.79Accuracy (%)93
UGI - Natural Intelligence54.36NatInt Score92.3
FormationEval97.2Accuracy (%)91.5
Wolfram LLM Benchmarking Project61.6Correct Functionality (%)91.3
MATH-MC Level 399.28Accuracy (%)91.2
MATH-MC Level 599.69Accuracy (%)90.4

Interactive version: theaggregate.ai/model?slug=kimi-k2-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.