TurkBench - Overall: leaderboard

Metric: Mean task score (0-100). Source: huggingface.co. 37 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B85.74
2Qwen 3.5 122B A10B85.35
3Qwen 3.5 35B A3B84.09
4GLM-5 FP883.11
5Qwen 3.5 27B80.52
6MiniMax-M2.580.51
7MiniMax-M279.74
8GPT-OSS-120B78.63
9DeepSeek V3.2 Exp77.14
10GLM-4.676.88
11Step 3.5 Flash75.65
12DeepSeek V3.175.19
13Qwen 3 Next 80B A3B Instruct74.95
14GLM-4.7 Flash74.95
15Qwen 3 30B A3B 2507 Instruct73.41

Interactive version: theaggregate.ai/benchmark?slug=turkbench-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.