AGC-Bench - slang_generation — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.51.52
2DeepSeek V3.21.26
3Claude Opus 4.51.24
4GLM-51.21
5Claude Sonnet 41.14
6Claude Opus 4.61.13
7Llama 3.2 11B Instruct1.1
8Gemma 4 31B (IT)1.03
9Gemini 2.5 Flash1.03
10GLM-5-Turbo1
11Gemma 4 26B A4B (IT)0.99
12DeepSeek V3.10.97
13DeepSeek V3.2 Exp0.91
14GPT-5.4 Mini0.81
15Claude 3.7 Sonnet0.73

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-slang-generation · How the rankings work · Data refreshed daily, snapshot 2026-07-22.