Kimi K3 (Low): benchmark results
Provider: Moonshot. Released 2026-07-16. Access: Open.
Unified ELO 1696 ± 1, rank #148 of 3078 rated models, from 92 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Dart | 66 | Accuracy (%) | 100 |
| FlavourBench - Pairing | 73.72 | Pairing Family Score (0-100) | 100 |
| PSF-Med - Frontier Hardest 500 | 5.71 | Paraphrase Flip Rate (%) | 100 |
| AA Omniscience - Software Engineering (SWE) - HTML | 82 | Accuracy (%) | 99.8 |
| AA Omniscience - Software Engineering (SWE) - PHP | 80 | Accuracy (%) | 99.7 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 75.28 | Accuracy (%) | 99.7 |
| AA Omniscience - Software Engineering (SWE) - C | 81 | Accuracy (%) | 99.3 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 64 | Accuracy (%) | 99.3 |
| AA Omniscience - Software Engineering (SWE) - Swift | 76 | Accuracy (%) | 99.3 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 70.91 | Accuracy (%) | 99 |
| AA Omniscience - Software Engineering (SWE) - Python | 64.5 | Accuracy (%) | 99 |
| AA Omniscience - Software Engineering (SWE) - Rust | 80 | Accuracy (%) | 99 |
Interactive version: theaggregate.ai/model?slug=kimi-k3-low · How It Works · Data refreshed daily, snapshot 2026-09-19.