Kimi K2.5 (Non-reasoning) — benchmark results

Kimi K2.5 evaluated with reasoning disabled. Provider: Moonshot. Released 2026-01-27. Access: Open.

Unified ELO 1652 ± 30, rank #363 of 1776 rated models, from 79 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI - Natural Intelligence60.32NatInt Score94.7
UGI - Writing61.51Writing Score94.4
AA Omniscience - Software Engineering (SWE) - PHP46Accuracy (%)80.8
AA Omniscience - Software Engineering (SWE) - Rust66Accuracy (%)80.6
CLEM PrivateShared92.69Game Clemscore (%)79.3
AA Omniscience - Software Engineering (SWE) - Python37.5Accuracy (%)78.6
AA Omniscience - Software Engineering (SWE) - HTML48Accuracy (%)77.7
AA Omniscience - Software Engineering (SWE) - R30Accuracy (%)77.7
UGI Leaderboard44UGI Score77.5
CLEM TextMapWorld GraphReasoning73.16Game Clemscore (%)76.9
AA Omniscience - Software Engineering (SWE) - Go32Accuracy (%)76.8
CLEM Deal or No Deal78.59Game Clemscore (%)76.7

Interactive version: theaggregate.ai/model?slug=kimi-k2-5-non-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.