Benchmarking Large Language Models for Graphem — leaderboard

Metric: Direct (self-reported). Source: benchmarklist.com. 37 models tracked.

Top models

#ModelScore
1Qwen 3 8B100.15
2Qwen 3.5 2B87.3
3Qwen 2.5 7B79.39
4glm-4-9B57.56
5Gemma 3 4B56.69
6Qwen 3.5 4B43.98
7GLM-4 32B35.62
8Qwen 2.5 32B35.48
9Qwen 3 32B32.46
10Qwen 3 14B32.11
11Gemma 3 12B28.77
12Qwen 3.5 9B27.47
13Qwen 3.5 35B A3B26.93
14Gemma 2 27B24.56
15Llama 3.3 70B Instruct23.48

Interactive version: theaggregate.ai/benchmark?slug=benchmarking-large-language-models-for-graphem · How the rankings work · Data refreshed daily, snapshot 2026-07-22.