PluriHarms: leaderboard

Metric: Mean Absolute Error vs Individual Ratings (0-1; k-shot personalised steering). Source: arxiv.org. Saturation forecast: Around December 2026. 13 models tracked.

Top models

#ModelScore
1GPT-50.2
2GPT-4.10.2
3Qwen 3 8B0.2
4Claude 3.7 Sonnet0.2
5Claude Opus 40.2
6Claude Sonnet 40.21
7Qwen 3 32B0.21
8Claude Sonnet 4.50.21
9Qwen 3 14B0.21
10Claude 3.5 Haiku0.21
11Claude Haiku 4.50.22
12Qwen 3 4B0.23
13Claude 3 Haiku0.23

Interactive version: theaggregate.ai/benchmark?slug=pluriharms · How It Works · Data refreshed daily, snapshot 2026-09-25.