pythia-160m: benchmark results

Provider: EleutherAI. Access: Open.

Unified ELO 1231 ± 12, rank #2593 of 2656 rated models, from 83 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - High School Statistics47.69Accuracy (%)86.1
Open Korean LLM - KorNAT-Harmless64.32Normalized accuracy (%)73.1
Open Korean LLM - Ko-GPQA-Diamond24.75Normalized accuracy (%)69.5
MMLU-by-task - Moral Scenarios27.71Accuracy (%)62.5
Open LLM Leaderboard - MuSR41.79Score58.1
MMLU-by-task - TruthfulQA MC244.26Accuracy (%)47.3
MMLU-by-task - Professional Medicine44.85Accuracy (%)45.5
Open Korean LLM - KorNAT-Helpful46.12Normalized accuracy (%)42.4
MMLU-by-task - TruthfulQA MC125.09Accuracy (%)33.6
MMLU-by-task - Professional Accounting28.01Accuracy (%)32.5
MMLU-by-task - High School Biology31.29Accuracy (%)31.9
MMLU-by-task - Medical Genetics32Accuracy (%)31.6

Interactive version: theaggregate.ai/model?slug=pythia-160m · How It Works · Data refreshed daily, snapshot 2026-09-19.