AGC-Bench - pun_eval — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1DeepSeek V3 (0324)1.52
2Mistral Medium 3.11.42
3GPT-5.4 Mini1.4
4Claude Opus 4.71.33
5DeepSeek V3 Chat1.22
6Ministral 3 8B1.22
7GPT-5.51.04
8Gemma 4 26B A4B (IT)0.94
9GPT-5.40.93
10Claude Opus 4.50.9
11GPT-5.4 Nano0.87
12NVIDIA Nemotron Nano 9B V20.83
13Qwen 3 Next 80B A3B Instruct0.8
14Llama 3 8B Instruct0.75
15Kimi K2 09050.7

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-pun-eval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.