glm-4-9B — benchmark results

Provider: Zhipu. Released 2024-06-04. Access: Open.

Unified ELO 1370 ± 51, rank #1342 of 1776 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Benchmarking Large Language Models for Graphem57.56Direct (self-reported)86.1
Open PL LLM - RAG71.01Average RAG Score (%)80.4
Open LLM Leaderboard - MuSR14.19Score77.6
Open LLM Leaderboard - MMLU-Pro34.94Score75.5
Open LLM Leaderboard - BBH35.81Score72.7
Open PL LLM - Generative60.68Average Generative Score (%)72.7
Open LLM Leaderboard - GPQA8.84Score72.5
Open PL LLM Leaderboard55.32Average Score (%)69.2
Greek MMLU - STEM63.19Accuracy (%)66.7
Greek MMLU64.98Accuracy (%)65.4
Greek MMLU - Other63.41Accuracy (%)65.4
Open PL LLM - Multiple Choice48.34Average Multiple-Choice Score (%)64.7

Interactive version: theaggregate.ai/model?slug=glm-4-9b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.