CommunityBench - Preference Identification: leaderboard

Metric: Accuracy (%). Source: arxiv.org. Saturation forecast: Around 2033. 17 models tracked.

Top models

#ModelScore
1DeepSeek V3 (0324)40.34
2GPT-4o38.62
3Qwen 3 14B38.13
4Grok 437.34
5Qwen 3 32B36.98
6Qwen 2.5 72B Instruct36.75
7GLM-4 32B (0414)36.45
8Qwen 2.5 14B Instruct35.96
9Qwen 3 8B35.73
10Qwen 2.5 7B Instruct35.26
11Llama 3.3 70B Instruct34.34
12Llama 3.1 70B Instruct34.24
13GLM-4 9B (0414)33.12
14DeepSeek R1 052831.54
15Mistral 7B Instruct (v0.3)31.35

Interactive version: theaggregate.ai/benchmark?slug=communitybench-preference-identification · How It Works · Data refreshed daily, snapshot 2026-09-25.