Qwen2.5-14B-Gutenberg-1e-Delta — benchmark results

v000000's DPO fine-tune of Qwen2.5 14B Instruct on the Gutenberg literary-prose preference dataset. Provider: Alibaba. Released 2024-09-20. Access: Open.

Unified ELO 1516 ± 14, rank #744 of 1776 rated models, from 130 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard786.37Average Score (%)98.9
Open LLM Leaderboard - MATH Level 552.64Score98
Open LLM Leaderboard - IFEval80.45Score97.8
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task94Accuracy (%)93.5
Open Arabic LLM - Aratrust Unfairness94.55Accuracy (%)91
Open Arabic LLM - Aratrust Privacy96.49Accuracy (%)90.4
Open LLM Leaderboard - BBH48.62Score89
Open LLM Leaderboard - MMLU-Pro43.67Score87.4
Open Arabic LLM - Aratrust MentalHealth94.74Accuracy (%)87.3
Open Arabic LLM - Arabic MMLU Computer Science (Middle School)92.59Accuracy (%)87
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task91.33Accuracy (%)83.6
Open Arabic LLM - Arabic MMLU HT Management69.9Accuracy (%)80.6

Interactive version: theaggregate.ai/model?slug=qwen2-5-14b-gutenberg-1e-delta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.