Qwen2.5-14B-Gutenberg-1e-Delta: benchmark results

v000000's DPO fine-tune of Qwen2.5 14B Instruct on the Gutenberg literary-prose preference dataset. Provider: Alibaba. Released 2024-09-20. Access: Open.

Unified ELO 1571 ± 1, rank #359 of 1392 rated models, from 130 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard53.14Average Score (%)99.7
Open LLM Leaderboard - MATH Level 552.64Score98
Open LLM Leaderboard - IFEval80.45Score97.8
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task94Accuracy (%)93.5
Open Arabic LLM - Aratrust Unfairness94.55Accuracy (%)91
Open Arabic LLM - Aratrust Privacy96.49Accuracy (%)90.4
Open LLM Leaderboard - BBH48.62Score89
Open LLM Leaderboard - MMLU-Pro43.67Score87.4
Open Arabic LLM - Aratrust MentalHealth94.74Accuracy (%)87.3
Open Arabic LLM - Arabic MMLU Computer Science (Middle School)92.59Accuracy (%)87
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task91.33Accuracy (%)83.6
Open Arabic LLM - Arabic MMLU HT Management69.9Accuracy (%)80.6

Interactive version: theaggregate.ai/model?slug=qwen2-5-14b-gutenberg-1e-delta · How It Works · Data refreshed daily, snapshot 2026-09-05.