MoE_13B_DPO: benchmark results

Provider: Other. Access: Open.

Unified ELO 1499 ± 33, rank #1112 of 2656 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC62.61Accuracy (%)91.7
Open Chinese LLM - WinoGrande67.48Accuracy (%)83.4
Open Portuguese LLM - ASSIN2 RTE92.57Macro F1 (%)80.4
Open Portuguese LLM - FaQuAD NLI77.36Macro F1 (%)79.5
Open Chinese LLM - HellaSwag61.77Accuracy (%)64.7
Open Chinese LLM - ARC Challenge54.1Accuracy (%)63.2
Open Portuguese LLM - ENEM64.45Accuracy (%)58.6
Open Portuguese LLM - BLUEX53.13Accuracy (%)55
Open Portuguese LLM - OAB Exams42.64Accuracy (%)52.6
Open Chinese LLM Leaderboard56.7Average Score (%)51.8
Open Chinese LLM - GSM8K42Accuracy (%)42.1
Open Chinese LLM - C-Eval Semantic61.79Accuracy (%)24.6

Interactive version: theaggregate.ai/model?slug=moe-13b-dpo · How It Works · Data refreshed daily, snapshot 2026-09-19.