MAmmoTH2-7B-Plus: benchmark results

Provider: CMU. Released 2024-05-06. Access: Open.

Unified ELO 1436 ± 1, rank #1009 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC56.66Accuracy (%)71.2
Open LLM Leaderboard - MATH Level 518.58Score68.4
Open LLM Leaderboard - IFEval55.75Score67.6
Open Korean LLM Leaderboard37.55Average Score (%)60
Open LLM Leaderboard - MuSR10.11Score50.3
Open Chinese LLM - ARC Challenge51.54Accuracy (%)46
Open Chinese LLM - GSM8K44.28Accuracy (%)45.5
Open LLM Leaderboard - MMLU-Pro22.41Score37
Open LLM Leaderboard - GPQA4.03Score35.2
Open Chinese LLM - C-Eval Semantic63.59Accuracy (%)34.1
Open Chinese LLM Leaderboard53.57Average Score (%)31.2
Open Chinese LLM - CMMLU48.46Accuracy (%)29.4

Interactive version: theaggregate.ai/model?slug=mammoth2-7b-plus · How It Works · Data refreshed daily, snapshot 2026-09-05.