Kimi K2.5 (Thinking): benchmark results

Kimi K2.5 evaluated with thinking enabled. Provider: Moonshot. Released 2026-01-27. Access: Open.

Unified ELO 1653 ± 1, rank #232 of 1761 rated models, from 155 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Rust78Accuracy (%)97.6
AA Omniscience - Software Engineering (SWE) - TypeScript60Accuracy (%)97.3
AA Omniscience - Software Engineering (SWE) - HTML66Accuracy (%)96.8
AA Omniscience - Software Engineering (SWE) - Python47Accuracy (%)96.6
AA Omniscience - Software Engineering (SWE) - Dart42Accuracy (%)96.4
AA Omniscience - Software Engineering (SWE) - Go50Accuracy (%)96.4
UGI Leaderboard55.23UGI Score96.3
AA TAU-2 Bench95.91Accuracy (%)96.2
AA Omniscience - Software Engineering (SWE) - Kotlin46Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - Swift64Accuracy (%)96.1
AA Omniscience - Software Engineering (SWE) - C70Accuracy (%)95.9
AA Omniscience - Software Engineering (SWE) - R40Accuracy (%)95.6

Interactive version: theaggregate.ai/model?slug=kimi-k2-5-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.