TurkBench - Commonsense Reasoning: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1Qwen 3.5 35B A3B95.08
2Qwen 3.5 122B A10B95.08
3GPT-OSS-120B94.67
4Qwen 3.5 27B93.44
5GLM-4.7 Flash93.44
6Step 3.5 Flash93.44
7Qwen 3.5 397B A17B93.03
8MiniMax-M2.593.03
9Qwen 3 Next 80B A3B Instruct92.21
10DeepSeek V3.191.8
11Gemma 3 27B (IT)91.39
12Gemma 3 12B (IT)91.39
13Qwen 3 32B90.98
14Qwen 3 30B A3B 2507 Instruct90.57
15Qwen 2.5 14B Instruct90.16

Interactive version: theaggregate.ai/benchmark?slug=turkbench-commonsense-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.