Inkling Small: benchmark results
Provider: Thinking Machines. Released 2026-07-30. Access: Open.
Unified ELO 1836 ± 12, rank #105 of 2656 rated models, from 262 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - GLP - Logical Reasoning | 98.5 | Score (%) | 100 |
| Nejumi 4 - MT-Bench (Japanese) | 98.75 | Score (%) | 98.8 |
| AA Omniscience - Software Engineering (SWE) - Rust | 78 | Accuracy (%) | 97.6 |
| AA-AnalystAgent - Pass@K | 80 | Pass@K (%) | 96.9 |
| Vals AI CorpFin v2 | 69.62 | Accuracy (%) | 96.2 |
| Nejumi 4 - ALT - Toxicity | 86.39 | Score (%) | 95.3 |
| AA Omniscience - Software Engineering (SWE) - C | 69 | Accuracy (%) | 95.2 |
| EnterpriseOps-Gym-AA - Drive | 62.86 | Task Success (%) | 94.7 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 44 | Accuracy (%) | 94.5 |
| SEAL - AudioMultiChallenge - Text Output | 54.87 | Score | 94.1 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 52.73 | Accuracy (%) | 93.5 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 48.89 | Accuracy (%) | 93.3 |
Interactive version: theaggregate.ai/model?slug=inkling-small · How It Works · Data refreshed daily, snapshot 2026-09-19.