AGC-Bench - cue_word_story — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GLM-5.11.25
2Kimi K2 09051.16
3GLM-5-Turbo1.15
4Gemini 2.5 Flash1.04
5GPT-5.51.04
6GPT-5.11.02
7GPT-5.41.02
8DeepSeek V3.10.93
9Claude Sonnet 4.50.92
10DeepSeek V3.2 Exp0.91
11Mistral Medium 3.10.91
12GLM-4.60.89
13ERNIE 4.5 300B A47B0.89
14Claude Opus 4.70.87
15Claude Opus 4.60.84

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-cue-word-story · How the rankings work · Data refreshed daily, snapshot 2026-07-22.