TurkBench - Truthfulness: leaderboard

Metric: LLM-as-a-judge score (0-100). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1Qwen 3.5 122B A10B91.79
2Qwen 3.5 27B91.39
3Qwen 3.5 397B A17B91.08
4GLM-5 FP890.54
5Qwen 3.5 35B A3B89.24
6MiniMax-M288.03
7MiniMax-M2.587.85
8DeepSeek V3.2 Exp83.72
9Step 3.5 Flash82.11
10MiMo-V2-Flash81.61
11DeepSeek V3.177.21
12GLM-4.7 Flash77.13
13GPT-OSS-120B75.33
14Qwen 3 Next 80B A3B Instruct67.89
15GLM-4.667.04

Interactive version: theaggregate.ai/benchmark?slug=turkbench-truthfulness · How It Works · Data refreshed daily, snapshot 2026-09-19.