Llemma-7B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1369 ± 17, rank #2358 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SWE-Arena1002Elo Score80.6
Open LLM Leaderboard v1 - GSM8K33.28Accuracy (%) (5-shot)49.4
Hallucinations Leaderboard41.9Average Task Score (score)44.7
TheoremQA17.2Score (%)36.4
Open LLM Leaderboard v1 - MMLU47.87Accuracy (%) (5-shot)26.9
Open LLM Leaderboard v1 - ARC Challenge46.16Normalized accuracy (%) (25-shot)21.4
Open LLM Leaderboard v1 - HellaSwag62.98Normalized accuracy (%) (10-shot)16.4
Open LLM Leaderboard v1 - WinoGrande63.3Accuracy (%) (5-shot)16.1
Science Leaderboard28Average Accuracy (%)12.1
BiGGen-Bench2.27Average Score (1-5)10.8
Open LLM Leaderboard v1 - TruthfulQA MC238.88MC2 (%) (0-shot)9.4

Interactive version: theaggregate.ai/model?slug=llemma-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.