gpt-neo-125m: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1217 ± 11, rank #2872 of 2928 rated models, from 80 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - High School Statistics45.83Accuracy (%)77
MMLU-by-task - High School Physics31.13Accuracy (%)56
MMLU-by-task - TruthfulQA MC245.58Accuracy (%)53.7
MMLU-by-task - Professional Medicine44.85Accuracy (%)45.5
MMLU-by-task - College Computer Science34Accuracy (%)39.4
MMLU-by-task - Security Studies40Accuracy (%)39
MMLU-by-task - TruthfulQA MC125.83Accuracy (%)38.1
MMLU-by-task - College Physics22.55Accuracy (%)34.2
MMLU-by-task - High School Geography35.86Accuracy (%)33.8
MMLU-by-task - High School US History29.9Accuracy (%)33.7
Open LLM Leaderboard v1 - TruthfulQA MC245.58MC2 (%) (0-shot)31.4
MMLU-by-task - High School Government And Politics35.75Accuracy (%)31.2

Interactive version: theaggregate.ai/model?slug=gpt-neo-125m · How It Works · Data refreshed daily, snapshot 2026-09-23.