pythia-1B: benchmark results

Provider: EleutherAI. Released 2023-04-03. Access: Open.

Unified ELO 1184 ± 25, rank #2642 of 2656 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Portuguese LLM - FaQuAD NLI43.97Macro F1 (%)17.1
Open LLM Leaderboard - MuSR35.52Score15.2
Open LLM Leaderboard - IFEval22.08Score15.1
Open Portuguese LLM - ASSIN2 RTE46.5Macro F1 (%)14.8
Open Portuguese LLM - OAB Exams24.15Accuracy (%)12.1
Open Medical LLM - MMLU Professional Medicine26.84Accuracy (%)11.9
HELM Classic - bAbI37.86Exact Match (%)11.6
Open Medical LLM - MedMCQA31.63Accuracy (%)10.8
Open Medical LLM - PubMedQA58.2Accuracy (%)10.8
Open LLM Leaderboard - GPQA25.67Score9
Open Medical LLM - MMLU College Biology27.08Accuracy (%)8.5
Open Portuguese LLM - BLUEX19.19Accuracy (%)8.1

Interactive version: theaggregate.ai/model?slug=pythia-1b · How It Works · Data refreshed daily, snapshot 2026-09-19.