AGC-Bench - Problem Solving — leaderboard

Metric: JRT z-score. Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Kimi K2.51.02
2Claude Opus 4.70.92
3GPT-5.50.78
4Hermes 4 405B0.73
5GLM-4.70.72
6Claude Sonnet 4.50.7
7Claude Opus 4.50.69
8GLM-50.68
9GPT-4o0.62
10Claude Sonnet 4.60.61
11GLM-5-Turbo0.61
12Kimi K2.60.56
13Kimi K2 09050.53
14Mistral Large 30.51
15ERNIE 4.5 300B A47B0.5

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-problem-solving · How the rankings work · Data refreshed daily, snapshot 2026-07-22.