gpt-neo-125m: benchmark results
Provider: OpenAI. Access: API.
Unified ELO 1217 ± 11, rank #2872 of 2928 rated models, from 80 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MMLU-by-task - High School Statistics | 45.83 | Accuracy (%) | 77 |
| MMLU-by-task - High School Physics | 31.13 | Accuracy (%) | 56 |
| MMLU-by-task - TruthfulQA MC2 | 45.58 | Accuracy (%) | 53.7 |
| MMLU-by-task - Professional Medicine | 44.85 | Accuracy (%) | 45.5 |
| MMLU-by-task - College Computer Science | 34 | Accuracy (%) | 39.4 |
| MMLU-by-task - Security Studies | 40 | Accuracy (%) | 39 |
| MMLU-by-task - TruthfulQA MC1 | 25.83 | Accuracy (%) | 38.1 |
| MMLU-by-task - College Physics | 22.55 | Accuracy (%) | 34.2 |
| MMLU-by-task - High School Geography | 35.86 | Accuracy (%) | 33.8 |
| MMLU-by-task - High School US History | 29.9 | Accuracy (%) | 33.7 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 45.58 | MC2 (%) (0-shot) | 31.4 |
| MMLU-by-task - High School Government And Politics | 35.75 | Accuracy (%) | 31.2 |
Interactive version: theaggregate.ai/model?slug=gpt-neo-125m · How It Works · Data refreshed daily, snapshot 2026-09-23.