LLM Benchmarker Suite — leaderboard

FormulaMonks multi-benchmark suite averaging classic LLM tasks including MMLU, TriviaQA, GSM8K, HumanEval, BoolQ, HellaSwag, and Winogrande.

Metric: Average Score (%). Source: github.com. Status: saturated. 8 models tracked.

Top models

#ModelScore
1Llama 2 70B62.53
2falcon-40B56.36
3Llama 2 13B53.01
4mpt-30B48.93
5Llama 2 7B46.88
6mpt-7B41.96
7falcon-7B40.74

Interactive version: theaggregate.ai/benchmark?slug=llm-benchmarker-suite · How the rankings work · Data refreshed daily, snapshot 2026-07-22.