MAmmoTH2-7B-Plus — benchmark results

Provider: CMU. Released 2024-05-06. Access: Open.

Unified ELO 1400 ± 14, rank #1226 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC56.66Accuracy (%)71.2
Open Korean LLM Leaderboard341.23Average Score (%)69.9
Open LLM Leaderboard - MATH Level 518.58Score68.4
Open LLM Leaderboard - IFEval55.75Score67.6
Open LLM Leaderboard - MuSR10.11Score50.3
Open Chinese LLM - ARC Challenge51.54Accuracy (%)46
Open Chinese LLM - GSM8K44.28Accuracy (%)45.5
Open LLM Leaderboard - MMLU-Pro22.41Score36.9
Open LLM Leaderboard - GPQA4.03Score35.2
Open Chinese LLM - C-Eval Semantic63.59Accuracy (%)34.1
Open Chinese LLM Leaderboard53.57Average Score (%)31.2
Open Chinese LLM - CMMLU48.46Accuracy (%)29.4

Interactive version: theaggregate.ai/model?slug=mammoth2-7b-plus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.