pythia-160m: benchmark results
Provider: EleutherAI. Access: Open.
Unified ELO 1231 ± 12, rank #2593 of 2656 rated models, from 83 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MMLU-by-task - High School Statistics | 47.69 | Accuracy (%) | 86.1 |
| Open Korean LLM - KorNAT-Harmless | 64.32 | Normalized accuracy (%) | 73.1 |
| Open Korean LLM - Ko-GPQA-Diamond | 24.75 | Normalized accuracy (%) | 69.5 |
| MMLU-by-task - Moral Scenarios | 27.71 | Accuracy (%) | 62.5 |
| Open LLM Leaderboard - MuSR | 41.79 | Score | 58.1 |
| MMLU-by-task - TruthfulQA MC2 | 44.26 | Accuracy (%) | 47.3 |
| MMLU-by-task - Professional Medicine | 44.85 | Accuracy (%) | 45.5 |
| Open Korean LLM - KorNAT-Helpful | 46.12 | Normalized accuracy (%) | 42.4 |
| MMLU-by-task - TruthfulQA MC1 | 25.09 | Accuracy (%) | 33.6 |
| MMLU-by-task - Professional Accounting | 28.01 | Accuracy (%) | 32.5 |
| MMLU-by-task - High School Biology | 31.29 | Accuracy (%) | 31.9 |
| MMLU-by-task - Medical Genetics | 32 | Accuracy (%) | 31.6 |
Interactive version: theaggregate.ai/model?slug=pythia-160m · How It Works · Data refreshed daily, snapshot 2026-09-19.