TurkBench - Summarization: leaderboard

Metric: LLM-as-a-judge score (0-100). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1MiniMax-M2.584.09
2MiniMax-M283.16
3Qwen 3 30B A3B 2507 Instruct81.87
4GPT-OSS-120B81.82
5DeepSeek V3.2 Exp81.82
6Qwen 3 Next 80B A3B Instruct81.7
7Step 3.5 Flash80.72
8DeepSeek V3.180.13
9Gemma 3 12B (IT)77.47
10aya-expanse-8B76.97
11GLM-4.676.45
12Qwen 3.5 27B76.41
13Qwen 3.5 35B A3B75.59
14Qwen 2.5 14B Instruct75
15Qwen 3.5 122B A10B74.5

Interactive version: theaggregate.ai/benchmark?slug=turkbench-summarization · How It Works · Data refreshed daily, snapshot 2026-09-19.