AGC-Bench - c3_crosstalk — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Claude Opus 4.72.02
2Claude 3.7 Sonnet1.83
3GLM-4.71.42
4Claude Sonnet 4.51.39
5Claude Opus 4.51.35
6Llama 3.3 70B Instruct1.13
7GPT-4o Mini1.09
8jamba-large-1.71.07
9Llama 4 Scout1.07
10GPT-4o1.05
11GLM-51.02
12Claude Opus 4.61
13Hermes 4 405B0.96
14GLM-5-Turbo0.95
15GPT-4.10.94

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-c3-crosstalk · How the rankings work · Data refreshed daily, snapshot 2026-07-22.