AGC-Bench - speak_to_structure — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Claude Opus 4.51.51
2GPT-5.51.49
3Claude Opus 4.71.47
4GPT-5.41.32
5Kimi K2 09051.15
6Claude Sonnet 4.51.13
7Kimi K2.51.07
8Claude Opus 4.61.05
9Claude Sonnet 41.05
10Kimi K2.61.03
11GLM-50.89
12GPT-5.4 Mini0.82
13GLM-5.10.8
14Claude 3.7 Sonnet0.79
15DeepSeek V3.1 Terminus0.77

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-speak-to-structure · How the rankings work · Data refreshed daily, snapshot 2026-07-22.