MAmmoTH2-7B-Plus — benchmark results
Provider: CMU. Released 2024-05-06. Access: Open.
Unified ELO 1400 ± 14, rank #1226 of 1776 rated models, from 15 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - TruthfulQA MC | 56.66 | Accuracy (%) | 71.2 |
| Open Korean LLM Leaderboard | 341.23 | Average Score (%) | 69.9 |
| Open LLM Leaderboard - MATH Level 5 | 18.58 | Score | 68.4 |
| Open LLM Leaderboard - IFEval | 55.75 | Score | 67.6 |
| Open LLM Leaderboard - MuSR | 10.11 | Score | 50.3 |
| Open Chinese LLM - ARC Challenge | 51.54 | Accuracy (%) | 46 |
| Open Chinese LLM - GSM8K | 44.28 | Accuracy (%) | 45.5 |
| Open LLM Leaderboard - MMLU-Pro | 22.41 | Score | 36.9 |
| Open LLM Leaderboard - GPQA | 4.03 | Score | 35.2 |
| Open Chinese LLM - C-Eval Semantic | 63.59 | Accuracy (%) | 34.1 |
| Open Chinese LLM Leaderboard | 53.57 | Average Score (%) | 31.2 |
| Open Chinese LLM - CMMLU | 48.46 | Accuracy (%) | 29.4 |
Interactive version: theaggregate.ai/model?slug=mammoth2-7b-plus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.