Kimi K2.5 (Thinking): benchmark results
Kimi K2.5 evaluated with thinking enabled. Provider: Moonshot. Released 2026-01-27. Access: Open.
Unified ELO 1653 ± 1, rank #232 of 1761 rated models, from 155 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Rust | 78 | Accuracy (%) | 97.6 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 60 | Accuracy (%) | 97.3 |
| AA Omniscience - Software Engineering (SWE) - HTML | 66 | Accuracy (%) | 96.8 |
| AA Omniscience - Software Engineering (SWE) - Python | 47 | Accuracy (%) | 96.6 |
| AA Omniscience - Software Engineering (SWE) - Dart | 42 | Accuracy (%) | 96.4 |
| AA Omniscience - Software Engineering (SWE) - Go | 50 | Accuracy (%) | 96.4 |
| UGI Leaderboard | 55.23 | UGI Score | 96.3 |
| AA TAU-2 Bench | 95.91 | Accuracy (%) | 96.2 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 46 | Accuracy (%) | 96.1 |
| AA Omniscience - Software Engineering (SWE) - Swift | 64 | Accuracy (%) | 96.1 |
| AA Omniscience - Software Engineering (SWE) - C | 70 | Accuracy (%) | 95.9 |
| AA Omniscience - Software Engineering (SWE) - R | 40 | Accuracy (%) | 95.6 |
Interactive version: theaggregate.ai/model?slug=kimi-k2-5-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.