gpt-j-6B — benchmark results

Provider: EleutherAI. Released 2021-06-09. Access: Open.

Unified ELO 1161 ± 12, rank #1727 of 1776 rated models, from 110 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Classic - BLiMP83.4Exact Match (%)90.3
MMLU-by-task - Machine Learning38.39Accuracy (%)75.4
HELM Classic - Synthetic Reasoning Natural19.88F1 (%)60.3
HELM Classic - MATH11.08Equivalent (%)57.4
HELM Classic - IMDB93.87Exact Match (%)56.1
MMLU-by-task - High School Mathematics27.41Accuracy (%)54.6
MMLU-by-task - College Mathematics32Accuracy (%)53.6
MMLU-by-task - Econometrics28.07Accuracy (%)47.2
HELM Classic - RAFT61.89Exact Match (%)47
HELM Classic - MATH Chain-of-Thought4.25Equivalent (%)44.1
HELM Classic - CNN/DailyMail13.11ROUGE-2 (%)39
HELM Classic - GSM8K3.6Exact Match (%)39

Interactive version: theaggregate.ai/model?slug=gpt-j-6b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.