GLM-4.7: benchmark results

Zhipu AI's GLM-4.7, a 355B sparse MoE (32B active) flagship reasoning model (December 2025). Provider: Zhipu. Released 2025-12-22. Access: Open.

Unified ELO 1631 ± 1, rank #178 of 1392 rated models, from 282 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - historical_analogy1.94Dataset z-score99.4
FormationEval98.6Accuracy (%)98.6
AGC-Bench - c3_crosstalk1.42Dataset z-score97.6
CLEM Hot Air Balloon90.89Game Clemscore (%)95.8
AGC-Bench - arn0.86Dataset z-score95.7
AGC-Bench - schnovel1.56Dataset z-score95.7
OpenCompass Research - LiveCodeBench v683.8Score (%)95.7
AGC-Bench - Problem Solving0.72JRT z-score95.1
AGC-Bench - lcc_metaphor1.21Dataset z-score95.1
AGC-Bench - simile_generation1.35Dataset z-score95
AGC-Bench - fig_qa2.38Dataset z-score94.5
AGC-Bench - Figurative Language1.02JRT z-score93.9

Interactive version: theaggregate.ai/model?slug=glm-4-7 · How It Works · Data refreshed daily, snapshot 2026-09-05.