AGC-Bench - Figurative Language — leaderboard

Metric: JRT z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Claude Opus 4.61.33
2Claude Opus 4.71.1
3Gemma 4 31B (IT)1.1
4GLM-5.11.09
5GLM-4.71.02
6GLM-50.95
7GLM-5-Turbo0.87
8Gemma 4 26B A4B (IT)0.87
9Gemini 2.5 Flash0.83
10Claude Opus 4.50.82
11ERNIE 4.5 300B A47B0.71
12GPT-5.10.7
13GPT-5.40.69
14GPT-5.50.64
15GPT-5.4 Mini0.63

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-figurative-language · How the rankings work · Data refreshed daily, snapshot 2026-07-22.