Ornith-1.5-397B: benchmark results
Provider: Ornith. Released 2026-08-19. Access: Open.
Unified ELO 1694 ± 1, rank #158 of 3078 rated models, from 34 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Humanity's Last Exam (Self-Reported, No Tools) | 44.6 | Accuracy (%) | 100 |
| Nejumi 4 - ALT - Truthfulness | 85.65 | Score (%) | 93.8 |
| Humanity's Last Exam (Self-Reported, With Tools) | 56.1 | Accuracy (%) | 93.3 |
| Nejumi 4 - GLP - Semantic Analysis | 85.6 | Score (%) | 92.6 |
| Nejumi 4 - ALT - Ethics & Morality | 97 | Score (%) | 88.3 |
| Nejumi 4 - ALT Average | 88.69 | Score (%) | 84.4 |
| Nejumi 4 - MT-Bench (Japanese) | 97.19 | Score (%) | 84.4 |
| BenchLM | 65.3 | Overall Score | 83.2 |
| Nejumi 4 - Total Score | 81.61 | Score (%) | 79.7 |
| Nejumi 4 - GLP - Basic Language | 85.22 | Score (%) | 78.9 |
| Nejumi 4 - ALT - Bias | 91.22 | Score (%) | 78.5 |
| Nejumi 4 - GLP - Application Development | 65.17 | Score (%) | 78.1 |
Interactive version: theaggregate.ai/model?slug=ornith-1-5-397b · How It Works · Data refreshed daily, snapshot 2026-09-19.