lambda-qwen2.5-14B-dpo-test: benchmark results

tanliboy's experimental DPO fine-tune of Qwen2.5 14B Instruct on the UltraFeedback binarized dataset. Provider: Other. Released 2024-09-20. Access: Open.

Unified ELO 1573 ± 1, rank #346 of 1392 rated models, from 180 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval82.31Score99
Open LLM Leaderboard - MATH Level 554.61Score99
Open Arabic LLM - Aratrust Unfairness96.36Accuracy (%)98.4
Open Korean LLM Leaderboard50.37Average Score (%)98.2
Open Arabic LLM - Arabic MMLU Arabic Language (Middle School)85.19Accuracy (%)98.1
Open Arabic LLM - Arabic MMLU Computer Science (University)81.25Accuracy (%)97.8
Open Arabic LLM - Arabic MMLU Management (University)81.33Accuracy (%)97.2
Open Arabic LLM - Aratrust Privacy98.25Accuracy (%)97.2
Open Arabic LLM - Arabic MMLU Computer Science (Middle School)96.3Accuracy (%)96.3
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task94Accuracy (%)93.5
Open Arabic LLM - Arabic MMLU Economics (Middle School)81.61Accuracy (%)92
Open LLM Leaderboard - GPQA14.99Score91

Interactive version: theaggregate.ai/model?slug=lambda-qwen2-5-14b-dpo-test · How It Works · Data refreshed daily, snapshot 2026-09-05.