AGC-Bench - metaphor_generation — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Claude Opus 4.52.4
2Claude Opus 4.62.11
3GPT-5.51.33
4GPT-5.11.3
5GPT-5.41.2
6Claude Sonnet 4.51.13
7jamba-large-1.71.05
8Gemma 4 31B (IT)1.03
9GPT-4.10.97
10GLM-5-Turbo0.93
11Claude Sonnet 40.89
12Gemma 4 26B A4B (IT)0.82
13GPT-4o0.79
14Hermes 3 - Llama-3.1 70B0.77
15Gemini 2.5 Flash0.75

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-metaphor-generation · How the rankings work · Data refreshed daily, snapshot 2026-07-22.