LLM Benchmarker Suite — leaderboard
FormulaMonks multi-benchmark suite averaging classic LLM tasks including MMLU, TriviaQA, GSM8K, HumanEval, BoolQ, HellaSwag, and Winogrande.
Metric: Average Score (%). Source: github.com. Status: saturated. 8 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Llama 2 70B | 62.53 |
| 2 | falcon-40B | 56.36 |
| 3 | Llama 2 13B | 53.01 |
| 4 | mpt-30B | 48.93 |
| 5 | Llama 2 7B | 46.88 |
| 6 | mpt-7B | 41.96 |
| 7 | falcon-7B | 40.74 |
Interactive version: theaggregate.ai/benchmark?slug=llm-benchmarker-suite · How the rankings work · Data refreshed daily, snapshot 2026-07-22.