juud-Mistral-7B-dpo: benchmark results

Provider: Other. Released 2024-02-07. Access: Open.

Unified ELO 1371 ± 1, rank #1220 of 1392 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC53.91Accuracy (%)52.1
Open Korean LLM Leaderboard33.73Average Score (%)35.7
Open Chinese LLM - HellaSwag54.84Accuracy (%)23.4
Open Chinese LLM - CMMLU47.03Accuracy (%)22.3
Open Chinese LLM - C-Eval Semantic59.2Accuracy (%)20.2
Open Chinese LLM - ARC Challenge45.9Accuracy (%)18.7
Open Chinese LLM - WinoGrande60.38Accuracy (%)16.3
Open Chinese LLM Leaderboard47.94Average Score (%)13.1
Open Chinese LLM - GSM8K14.33Accuracy (%)10.7

Interactive version: theaggregate.ai/model?slug=juud-mistral-7b-dpo · How It Works · Data refreshed daily, snapshot 2026-09-05.