Kimi K2.5: benchmark results

Moonshot Kimi K2.5 open 1T-parameter MoE model. Provider: Moonshot. Released 2026-01-27. Access: Open.

Unified ELO 1658 ± 1, rank #112 of 1392 rated models, from 571 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - Problem Solving1.02JRT z-score100
AGC-Bench - rpgbench1.74Dataset z-score100
AGC-Bench - tinyfabulist2.03Dataset z-score100
Diagram-MMU - Code Parsing56.97All Score (%)100
EHR-Complex62.3Avg. (self-reported)100
FINAL Bench Metacognitive78.54Metacognitive Score (self-reported)100
LLM Stats (InfoVQAtest)92.6Score (%)100
LLM Stats (MathVista-Mini)90.1Score (%)100
LLM Stats (OCRBench)92.3Score (%)100
LLM Stats (Seal-0)57.4Score (%)100
MATH-MC Level 399.73Accuracy (%)100
MERA Code - UnitTests34.21CodeBLEU (%)100

Interactive version: theaggregate.ai/model?slug=kimi-k2-5 · How It Works · Data refreshed daily, snapshot 2026-09-05.