MAmmoTH2-8x7B-Plus — benchmark results

TIGER-Lab's (U. Waterloo) Mixtral 8x7B tune on 10M web-mined WebInstruct pairs, with extra public instruction data for reasoning and chat (May 2024). Provider: CMU. Released 2024-05-06. Access: Open.

Unified ELO 1450 ± 15, rank #1002 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Science Leaderboard55.5Average Accuracy (%)90.9
Open Chinese LLM - GSM8K56.56Accuracy (%)78.9
Open Chinese LLM - TruthfulQA MC58.49Accuracy (%)77.2
Open Chinese LLM - ARC Challenge57.42Accuracy (%)74.5
Open Chinese LLM Leaderboard61.5Average Score (%)73
MixEval51.8Score70.6
Open Chinese LLM - C-Eval Semantic77.93Accuracy (%)66.9
Open Chinese LLM - HellaSwag61.38Accuracy (%)62.8
Open Chinese LLM - CMMLU56.53Accuracy (%)61.4
Open Chinese LLM - WinoGrande62.19Accuracy (%)37.8

Interactive version: theaggregate.ai/model?slug=mammoth2-8x7b-plus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.