HPR-Bench - Tag Inference - Life Stage: leaderboard

Metric: Avg@10 Tag Accuracy (%; mean of 10 samples). Source: arxiv.org. Saturation forecast: Around December 2026. 15 models tracked.

Top models

#ModelScore
1Qwen 3.6 Plus (Thinking)79.07
2Qwen 3.5 Plus (Thinking)77.44
3GLM-4.7 (Thinking)77.36
4GLM-5 (Thinking)76.91
5Qwen 3.5 397B A17B (Thinking)76.88
6Kimi K2.5 (Thinking)74.67
7Kimi K2 (Thinking)70.83
8DeepSeek V3.2 (Thinking)68.42
9DeepSeek R1 052864.12
10Qwen 3 235B A22B 2507 (Thinking)64.11
11Qwen 3 8B (Thinking)62.24
12Qwen 3 235B A22B 2507 Instruct59.44
13Qwen 3 8B (Non-reasoning)58.07

Interactive version: theaggregate.ai/benchmark?slug=hpr-bench-tag-inference-life-stage · How It Works · Data refreshed daily, snapshot 2026-09-25.