Ornith-1.5-397B: benchmark results

Provider: Ornith. Released 2026-08-19. Access: Open.

Unified ELO 1694 ± 1, rank #158 of 3078 rated models, from 34 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Humanity's Last Exam (Self-Reported, No Tools)44.6Accuracy (%)100
Nejumi 4 - ALT - Truthfulness85.65Score (%)93.8
Humanity's Last Exam (Self-Reported, With Tools)56.1Accuracy (%)93.3
Nejumi 4 - GLP - Semantic Analysis85.6Score (%)92.6
Nejumi 4 - ALT - Ethics & Morality97Score (%)88.3
Nejumi 4 - ALT Average88.69Score (%)84.4
Nejumi 4 - MT-Bench (Japanese)97.19Score (%)84.4
BenchLM65.3Overall Score83.2
Nejumi 4 - Total Score81.61Score (%)79.7
Nejumi 4 - GLP - Basic Language85.22Score (%)78.9
Nejumi 4 - ALT - Bias91.22Score (%)78.5
Nejumi 4 - GLP - Application Development65.17Score (%)78.1

Interactive version: theaggregate.ai/model?slug=ornith-1-5-397b · How It Works · Data refreshed daily, snapshot 2026-09-19.