AGC-Bench - newyorker_humor — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1GPT-5.51.06
2Claude Opus 4.61.01
3Claude Sonnet 4.50.95
4Claude Opus 4.70.95
5Claude Opus 4.50.95
6GPT-4.10.87
7Claude 3.7 Sonnet0.85
8Claude Sonnet 40.85
9GPT-5.40.82
10GPT-5.10.81
11GPT-4o0.77
12Claude Sonnet 4.60.71
13GLM-4.60.66
14Kimi K2.50.63
15GPT-5.4 Mini0.53

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-newyorker-humor · How the rankings work · Data refreshed daily, snapshot 2026-07-22.