Qwen2.5-14B-Gutenberg-1e-Delta — benchmark results
v000000's DPO fine-tune of Qwen2.5 14B Instruct on the Gutenberg literary-prose preference dataset. Provider: Alibaba. Released 2024-09-20. Access: Open.
Unified ELO 1516 ± 14, rank #744 of 1776 rated models, from 130 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Korean LLM Leaderboard | 786.37 | Average Score (%) | 98.9 |
| Open LLM Leaderboard - MATH Level 5 | 52.64 | Score | 98 |
| Open LLM Leaderboard - IFEval | 80.45 | Score | 97.8 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task | 94 | Accuracy (%) | 93.5 |
| Open Arabic LLM - Aratrust Unfairness | 94.55 | Accuracy (%) | 91 |
| Open Arabic LLM - Aratrust Privacy | 96.49 | Accuracy (%) | 90.4 |
| Open LLM Leaderboard - BBH | 48.62 | Score | 89 |
| Open LLM Leaderboard - MMLU-Pro | 43.67 | Score | 87.4 |
| Open Arabic LLM - Aratrust MentalHealth | 94.74 | Accuracy (%) | 87.3 |
| Open Arabic LLM - Arabic MMLU Computer Science (Middle School) | 92.59 | Accuracy (%) | 87 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task | 91.33 | Accuracy (%) | 83.6 |
| Open Arabic LLM - Arabic MMLU HT Management | 69.9 | Accuracy (%) | 80.6 |
Interactive version: theaggregate.ai/model?slug=qwen2-5-14b-gutenberg-1e-delta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.