GLM-5.1 (Thinking): benchmark results

Zhipu GLM-5.1 evaluated with thinking enabled. Provider: Zhipu. Released 2026-04-07. Access: Open.

Unified ELO 1636 ± 1, rank #295 of 1761 rated models, from 88 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA TAU-2 Bench97.66Accuracy (%)97.9
Wolfram LLM Benchmarking Project67.8Correct Functionality (%)96
AA IFBench76.26Accuracy (%)95.1
UGI Leaderboard52.88UGI Score94.4
UGI - Writing61.74Writing Score93.8
UGI - Natural Intelligence57.47NatInt Score92.9
AA Omniscience - Software Engineering (SWE) - JavaScript49.09Accuracy (%)91
AA Terminal-Bench Hard43.18Accuracy (%)90.3
Qwen3.7 Launch - IFEval94.5Score (%)90
AA Omniscience - Software Engineering (SWE) - Dart34Accuracy (%)89.9
AA Omniscience - Software Engineering (SWE) - HTML48Accuracy (%)85.8
AA Omniscience - Software Engineering (SWE) - TypeScript40Accuracy (%)85.7

Interactive version: theaggregate.ai/model?slug=glm-5-1-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.