GLM-130B: benchmark results

Provider: Zhipu. Released 2022-08-04. Access: Open.

Unified ELO 1272 ± 31, rank #2535 of 2656 rated models, from 28 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Classic - CNN/DailyMail15.44ROUGE-2 (%)90.2
HELM Classic - Synthetic Reasoning Natural25.35F1 (%)77.9
HELM Classic - IMDB95.47Exact Match (%)75.8
HELM Classic - NarrativeQA70.59F1 (%)70.8
HELM Classic - NaturalQuestions Open Book64.24F1 (%)70.8
HELM Classic - XSUM13.24ROUGE-2 (%)70.7
HELM Classic - BoolQ78.37Exact Match (%)68.2
HELM Classic - Synthetic Reasoning Abstract25.16Exact Match (%)67.6
HELM Classic - MATH Chain-of-Thought5.91Equivalent (%)57.4
HELM Classic - Dyck54.87Exact Match (%)51.5
HELM Classic - GSM8K6.1Exact Match (%)51.5
HELM Classic - MMLU34.4Exact Match (%)50

Interactive version: theaggregate.ai/model?slug=glm-130b · How It Works · Data refreshed daily, snapshot 2026-09-19.