Benchmarking Large Language Models for Graphem: leaderboard

Metric: Direct (self-reported). Source: benchmarklist.com. 37 models tracked.

Top models

#ModelScore
1Qwen 3 8B100.15
2Qwen 3.5 2B87.3
3Qwen 2.5 7B79.39
4Qwen 3 4B57.72
5glm-4-9B57.56
6Gemma 3 4B56.69
7Qwen 3.5 4B43.98
8GLM-4 32B35.62
9Qwen 2.5 32B35.48
10Qwen 3 32B32.46
11Qwen 3 14B32.11
12Gemma 3 12B28.77
13Qwen 3.5 9B27.47
14Qwen 3.5 35B A3B26.93
15Gemma 2 27B24.56

Interactive version: theaggregate.ai/benchmark?slug=benchmarking-large-language-models-for-graphem · How It Works · Data refreshed daily, snapshot 2026-09-05.