HuggingFace Open LLM Leaderboard: leaderboard

The definitive open-source model leaderboard. Tests on IFEval, BBH, MATH, GPQA, MUSR, and MMLU-PRO. Community-driven and continuously updated.

Metric: Average score. Source: huggingface.co. Status: saturated. 4576 models tracked.

Top models

#ModelScore
1calme-3.2-instruct-78b52.08
2calme-3.1-instruct-78b51.29
3CalmeRys-78B-Orpo-v0.151.23
4calme-2.4-rys-78b50.77
5Qwen2.5-72B-Instruct-abliterated48.11
6Qwen2.5-72B-Instruct47.98
7calme-2.1-qwen2.5-72b47.86
8Homer-v1.0-Qwen2.5-72B47.46
9qwen2.5-test-32b-it47.37
10Linkbricks-Horizon-AI-Avengers-V1-32B47.34

Interactive version: theaggregate.ai/benchmark?slug=huggingface-open-llm-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.