GLM-4.6 (Reasoning): benchmark results

GLM-4.6 evaluated with reasoning enabled. Provider: Zhipu. Released 2025-09-30. Access: Open.

Unified ELO 1591 ± 1, rank #474 of 1761 rated models, from 59 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - R38Accuracy (%)93.7
AA Omniscience - Software Engineering (SWE) - Go38Accuracy (%)91.5
AA Omniscience - Software Engineering (SWE) - Swift56Accuracy (%)91.5
UGI - Writing53.31Writing Score89.7
UGI - Natural Intelligence44.94NatInt Score88.2
AA Omniscience - Software Engineering (SWE) - Julia28Accuracy (%)85.2
AA Omniscience - Software Engineering (SWE) - JavaScript41.82Accuracy (%)85
AA Omniscience - Software Engineering (SWE) - Java25Accuracy (%)84.6
AA Omniscience - Software Engineering (SWE) - Rust62Accuracy (%)84
AA Omniscience - Software Engineering (SWE) - TypeScript37.78Accuracy (%)84
AA AIME 202586Accuracy (%)83.7
AA MMLU-Pro82.92Accuracy (%)81.2

Interactive version: theaggregate.ai/model?slug=glm-4-6-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.