AGC-Bench - irfl — leaderboard

Metric: Dataset z-score. Source: huggingface.co. 33 models tracked.

Top models

#ModelScore
1GPT-5.41.59
2GPT-5.51.53
3GPT-4o1.3
4GPT-4o Mini1.11
5Gemma 3 12B (IT)0.89
6Mistral Small 3.10.8
7Llama 4 Scout0.69
8Claude Sonnet 4.60.58
9Gemma 4 26B A4B (IT)0.57
10Claude Opus 4.50.54
11Mistral Large 30.49
12Claude 3.7 Sonnet0.33
13Gemma 3 27B (IT)0.29
14Nova Lite (v1)0.22
15Kimi K2.50.08

Interactive version: theaggregate.ai/benchmark?slug=agc-bench-irfl · How the rankings work · Data refreshed daily, snapshot 2026-07-22.