Qwen2.5-Lumen-14B — benchmark results

v000000's preference-tuned (DPO) fine-tune of Qwen2.5-14B-Instruct targeting prompt adherence, storywriting, and roleplay. Provider: Alibaba. Released 2024-09-20. Access: Open.

Unified ELO 1522 ± 14, rank #713 of 1776 rated models, from 130 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 553.63Score98.6
Open Korean LLM Leaderboard785.51Average Score (%)98.5
Open LLM Leaderboard - IFEval80.64Score98.1
Open Arabic LLM - Aratrust Unfairness94.55Accuracy (%)91
Open Arabic LLM - Aratrust Privacy96.49Accuracy (%)90.4
Open LLM Leaderboard - BBH48.51Score88.8
Open Arabic LLM - Arabic MMLU Computer Science (University)78.12Accuracy (%)88.3
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task93.33Accuracy (%)87.7
Open Arabic LLM - Aratrust MentalHealth94.74Accuracy (%)87.3
Open LLM Leaderboard - MMLU-Pro43.36Score87.2
Open Arabic LLM - Arabic MMLU Computer Science (Middle School)92.59Accuracy (%)87
Open Arabic LLM - Arabic MMLU HT Management70.87Accuracy (%)84.9

Interactive version: theaggregate.ai/model?slug=qwen2-5-lumen-14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.