AGC-Bench - proparalogy — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Hermes 4 405B0.94
2GPT-5.50.9
3Olmo 3.1 32B Instruct0.87
4Kimi K2.50.86
5Claude Sonnet 4.60.86
6Claude Sonnet 4.50.86
7GPT-5.40.82
8GPT-5.10.78
9GPT-4.10.78
10Nova Lite (v1)0.78
11Mistral Medium 3.10.77
12GLM-4.60.71
13Gemini 2.5 Flash0.7
14Hermes 4 70B0.7
15GPT-4o0.7

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-proparalogy · How the rankings work · Data refreshed daily, snapshot 2026-07-22.