Smaug-Mixtral-v0.1 — benchmark results

Abacus.AI's Smaug-series fine-tune of Mixtral-8x7B using their DPO-Positive (DPOP) preference-training technique. Provider: Other. Released 2024-02-18. Access: Open.

Unified ELO 1420 ± 9, rank #1130 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR12.99Score71.4
Open Chinese LLM - TruthfulQA MC56.32Accuracy (%)69.3
Open LLM Leaderboard - IFEval55.54Score67.2
Open LLM Leaderboard - BBH31.92Score59.2
Open LLM Leaderboard - GPQA6.82Score57.4
Open Chinese LLM - ARC Challenge53.16Accuracy (%)53.6
Open Chinese LLM - C-Eval Semantic70.53Accuracy (%)52.8
Open LLM Leaderboard - MMLU-Pro26.13Score47.6
Open Chinese LLM - CMMLU53.02Accuracy (%)46.3
Open Chinese LLM - WinoGrande62.59Accuracy (%)45.8
Open LLM Leaderboard - MATH Level 59.52Score45.7
Open Chinese LLM - HellaSwag59.47Accuracy (%)44.5

Interactive version: theaggregate.ai/model?slug=smaug-mixtral-v0-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.