TurkBench - Complex Reasoning: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1MiniMax-M2.597.12
2Qwen 3.5 397B A17B95.19
3Qwen 3.5 122B A10B95.19
4Step 3.5 Flash93.27
5Qwen 3.5 35B A3B91.35
6GLM-5 FP889.42
7Qwen 3.5 27B84.62
8MiniMax-M281.73
9GPT-OSS-120B80.76
10DeepSeek V3.166.33
11DeepSeek V3.2 Exp65.38
12GLM-4.7 Flash55.77
13GLM-4.648.08
14Gemma 3 27B (IT)27.88
15Qwen 2.5 14B Instruct27.88

Interactive version: theaggregate.ai/benchmark?slug=turkbench-complex-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.