AGC-Bench - proparalogy: leaderboard

Metric: Dataset z-score. Source: huggingface.co. 82 models tracked.

Top models

#ModelScore
1Hermes 4 405B0.94
2GPT-5.50.9
3Olmo 3.1 32B Instruct0.87
4pixtral-large-24110.87
5Kimi K2.50.86
6Claude Sonnet 4.60.86
7Claude Sonnet 4.50.86
8GPT-5.40.82
9Qwen Turbo0.79
10GPT-5.10.78
11GPT-4.10.78
12Nova Lite (v1)0.78
13Mistral Medium 3.10.77
14GLM-4.60.71
15Gemini 2.5 Flash0.7

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-proparalogy · How It Works · Data refreshed daily, snapshot 2026-09-05.