AGC-Bench - pron_vs_prompt — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Kimi K2 09051.41
2Kimi K2.61.19
3GLM-5-Turbo1.17
4Kimi K2.51.12
5DeepSeek V3.2 Exp1.07
6GPT-5.4 Mini1.06
7Claude Opus 4.61.04
8DeepSeek V3.21.03
9GLM-4.71.01
10Claude Opus 4.71
11GPT-5.4 Nano1
12Gemma 4 31B (IT)0.99
13GLM-5.10.99
14GPT-5.40.99
15GLM-50.97

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-pron-vs-prompt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.