juud-Mistral-7B-dpo — benchmark results

Provider: Other. Released 2024-02-07. Access: Open.

Unified ELO 1328 ± 23, rank #1477 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard182.61Average Score (%)57.7
Open Chinese LLM - TruthfulQA MC53.91Accuracy (%)52.1
Open Chinese LLM - HellaSwag54.84Accuracy (%)23.4
Open Chinese LLM - CMMLU47.03Accuracy (%)22.3
Open Chinese LLM - C-Eval Semantic59.2Accuracy (%)20.2
Open Chinese LLM - ARC Challenge45.9Accuracy (%)18.7
Open Chinese LLM - WinoGrande60.38Accuracy (%)16.3
Open Chinese LLM Leaderboard47.94Average Score (%)13.1
Open Chinese LLM - GSM8K14.33Accuracy (%)10.7

Interactive version: theaggregate.ai/model?slug=juud-mistral-7b-dpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.