EmoHarbor: leaderboard

Metric: Mean of 10 Rubric Dimensions (1-5 Likert). Source: arxiv.org. Saturation forecast: Around October 2026. 20 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B (Thinking)4.13
2Gemini 2.5 Pro4.12
3DeepSeek R13.9
4QwQ-32B3.89
5Claude Sonnet 4 (Thinking)3.84
6GPT-53.77
7Claude 3.7 Sonnet3.65
8DeepSeek V3.1 (Thinking)3.58
9GPT-4o (2024-11-20)3.5
10GLM-4.5 (Thinking)3.36
11O3 Mini2.97
12Qwen 3 32B (Thinking)2.82
13Qwen 2.5 72B Instruct2.63
14Qwen 2.5 32B Instruct2.46
15Qwen 2.5 7B Instruct2.18

Interactive version: theaggregate.ai/benchmark?slug=emoharbor · How It Works · Data refreshed daily, snapshot 2026-09-25.