lambda-qwen2.5-14B-dpo-test — benchmark results

tanliboy's experimental DPO fine-tune of Qwen2.5 14B Instruct on the UltraFeedback binarized dataset. Provider: Other. Released 2024-09-20. Access: Open.

Unified ELO 1557 ± 13, rank #605 of 1776 rated models, from 180 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval82.31Score99
Open LLM Leaderboard - MATH Level 554.61Score99
Open Arabic LLM - Aratrust Unfairness96.36Accuracy (%)98.4
Open Arabic LLM - Arabic MMLU Arabic Language (Middle School)85.19Accuracy (%)98.1
Open Arabic LLM - Arabic MMLU Computer Science (University)81.25Accuracy (%)97.8
Open Arabic LLM - Arabic MMLU Management (University)81.33Accuracy (%)97.2
Open Arabic LLM - Aratrust Privacy98.25Accuracy (%)97.2
Open Korean LLM Leaderboard739.76Average Score (%)96.8
Open Arabic LLM - Arabic MMLU Computer Science (Middle School)96.3Accuracy (%)96.3
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task94Accuracy (%)93.5
Open Arabic LLM - Arabic MMLU Economics (Middle School)81.61Accuracy (%)92
Open LLM Leaderboard - GPQA14.99Score91

Interactive version: theaggregate.ai/model?slug=lambda-qwen2-5-14b-dpo-test · How the rankings work · Data refreshed daily, snapshot 2026-07-22.