pythia-1B-deduped: benchmark results

Provider: EleutherAI. Released 2023-04-03. Access: Open.

Unified ELO 1204 ± 14, rank #2896 of 2928 rated models, from 22 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Portuguese LLM - FaQuAD NLI43.97Macro F1 (%)17.1
Open LLM Leaderboard v1 - GSM8K1.14Accuracy (%) (5-shot)15.7
Open Portuguese LLM - ENEM19.94Accuracy (%)11.9
Open Medical LLM - MMLU Medical Genetics32Accuracy (%)11.4
Open Portuguese LLM - OAB Exams23.78Accuracy (%)11
Open Portuguese LLM - BLUEX20.58Accuracy (%)10.4
Open LLM Leaderboard v1 - HellaSwag49.65Normalized accuracy (%) (10-shot)10.2
Open LLM Leaderboard v1 - TruthfulQA MC238.94MC2 (%) (0-shot)9.6
Open Portuguese LLM - ASSIN2 RTE34.09Macro F1 (%)8.6
Open Medical LLM - MedMCQA30.6Accuracy (%)8.5
Open LLM Leaderboard v1 - ARC Challenge29.1Normalized accuracy (%) (25-shot)8.2
Open LLM Leaderboard v1 - WinoGrande53.59Accuracy (%) (5-shot)8

Interactive version: theaggregate.ai/model?slug=pythia-1b-deduped · How It Works · Data refreshed daily, snapshot 2026-09-23.