GLM-5.1: benchmark results

Zhipu GLM-5.1 model for reasoning, coding, and agentic tasks. Provider: Zhipu. Released 2026-03-27. Access: Open.

Unified ELO 1678 ± 1, rank #87 of 1392 rated models, from 417 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - cue_word_story1.25Dataset z-score100
AGC-Bench - simile_generation1.9Dataset z-score100
Are Agents Ready to Teach? A Multi-Stage Bench63.8Eq. pass (self-reported)100
BoxPwnr CTF Bench55.47Average Platform Completion (%)100
GACL - WordMatrix68.33Normalized Score (0-100)100
POLAR-Bench94.34Overall Mean (self-reported)100
SalesBench0.5150-Lead Reward100
TERMS-Bench11.7Mean Utility100
TimeSage-MT40.5Overall (self-reported)100
MERA - RCB63.24Accuracy (%)99.8
MERA - ruHateSpeech93.96Accuracy (%)99.3
MERA - USE77.75Grade, normalized (%)99

Interactive version: theaggregate.ai/model?slug=glm-5-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.