GLM-4 9B Chat: benchmark results
Zhipu AI's open GLM-4 9B chat model, the small tier of the GLM-4 family (June 2024). Provider: Zhipu. Released 2024-06-05. Access: Open.
Unified ELO 1466 ± 1, rank #865 of 1392 rated models, from 49 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Fin-Bias | 98.1 | Average Herding Score (with rating) (self-reported) | 88.9 |
| Open PL LLM - RAG | 69.3 | Average RAG Score (%) | 76.9 |
| Open PL LLM - Generative | 61.64 | Average Generative Score (%) | 74.5 |
| ChineseSafe Benchmark | 70.96 | Accuracy (%) | 74.1 |
| LogicKor - Reasoning | 7.07 | Score (0-10) | 73.3 |
| Open PL LLM Leaderboard | 56.61 | Average Score (%) | 72.4 |
| LogicKor - Multi-Turn | 7.28 | Score (0-10) | 72.1 |
| Greek MMLU - Other | 65.85 | Accuracy (%) | 71.6 |
| Open LLM Leaderboard - GPQA | 8.5 | Score | 70.7 |
| Polish EQ-Bench | 61.79 | EQ-Bench Score | 70.3 |
| TextClass Benchmark | 1616.51 | Meta-Elo (self-reported) | 70.1 |
| LogicKor - Writing | 8.64 | Score (0-10) | 68.3 |
Interactive version: theaggregate.ai/model?slug=glm-4-9b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.