AGC-Bench - Story / Narrative — leaderboard

Metric: JRT z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-5.40.89
2GPT-5.50.75
3GPT-5.10.73
4Mistral Medium 3.10.73
5GLM-5.10.71
6Kimi K2.50.7
7Kimi K2 09050.68
8Kimi K2.60.63
9Claude Opus 4.70.62
10DeepSeek V3.1 Terminus0.6
11GLM-5-Turbo0.6
12DeepSeek V3.2 Exp0.59
13Claude Opus 4.50.58
14Claude Sonnet 4.60.56
15Gemini 2.5 Flash0.55

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-story-narrative · How the rankings work · Data refreshed daily, snapshot 2026-07-22.