Smaug-72B-v0.1 — benchmark results

Abacus.AI's Qwen-72B-derived fine-tune using DPO-Positive, the first open-weights model to average over 80 on the Open LLM Leaderboard (February 2024). Provider: Other. Released 2024-02-02. Access: Open.

Unified ELO 1521 ± 18, rank #720 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - ARC Challenge67.66Accuracy (%)98.2
Open Chinese LLM - TruthfulQA MC67.02Accuracy (%)98.2
Open Chinese LLM Leaderboard73.16Average Score (%)98.2
Open Chinese LLM - HellaSwag75Accuracy (%)97.9
Open Chinese LLM - CMMLU72.32Accuracy (%)95.8
Open Chinese LLM - C-Eval Semantic90.6Accuracy (%)95.7
Open Chinese LLM - GSM8K70.13Accuracy (%)95.7
Open Chinese LLM - WinoGrande69.38Accuracy (%)90.1
Open LLM Leaderboard - MMLU-Pro40.26Score85.1
Open LLM Leaderboard - BBH43.13Score82.3
Open LLM Leaderboard - MuSR14.42Score78.8
Open LLM Leaderboard - GPQA9.84Score77.5

Interactive version: theaggregate.ai/model?slug=smaug-72b-v0-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.