gpt-j-6B — benchmark results
Provider: EleutherAI. Released 2021-06-09. Access: Open.
Unified ELO 1161 ± 12, rank #1727 of 1776 rated models, from 110 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Classic - BLiMP | 83.4 | Exact Match (%) | 90.3 |
| MMLU-by-task - Machine Learning | 38.39 | Accuracy (%) | 75.4 |
| HELM Classic - Synthetic Reasoning Natural | 19.88 | F1 (%) | 60.3 |
| HELM Classic - MATH | 11.08 | Equivalent (%) | 57.4 |
| HELM Classic - IMDB | 93.87 | Exact Match (%) | 56.1 |
| MMLU-by-task - High School Mathematics | 27.41 | Accuracy (%) | 54.6 |
| MMLU-by-task - College Mathematics | 32 | Accuracy (%) | 53.6 |
| MMLU-by-task - Econometrics | 28.07 | Accuracy (%) | 47.2 |
| HELM Classic - RAFT | 61.89 | Exact Match (%) | 47 |
| HELM Classic - MATH Chain-of-Thought | 4.25 | Equivalent (%) | 44.1 |
| HELM Classic - CNN/DailyMail | 13.11 | ROUGE-2 (%) | 39 |
| HELM Classic - GSM8K | 3.6 | Exact Match (%) | 39 |
Interactive version: theaggregate.ai/model?slug=gpt-j-6b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.