lambda-qwen2.5-14B-dpo-test — benchmark results
tanliboy's experimental DPO fine-tune of Qwen2.5 14B Instruct on the UltraFeedback binarized dataset. Provider: Other. Released 2024-09-20. Access: Open.
Unified ELO 1557 ± 13, rank #605 of 1776 rated models, from 180 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 82.31 | Score | 99 |
| Open LLM Leaderboard - MATH Level 5 | 54.61 | Score | 99 |
| Open Arabic LLM - Aratrust Unfairness | 96.36 | Accuracy (%) | 98.4 |
| Open Arabic LLM - Arabic MMLU Arabic Language (Middle School) | 85.19 | Accuracy (%) | 98.1 |
| Open Arabic LLM - Arabic MMLU Computer Science (University) | 81.25 | Accuracy (%) | 97.8 |
| Open Arabic LLM - Arabic MMLU Management (University) | 81.33 | Accuracy (%) | 97.2 |
| Open Arabic LLM - Aratrust Privacy | 98.25 | Accuracy (%) | 97.2 |
| Open Korean LLM Leaderboard | 739.76 | Average Score (%) | 96.8 |
| Open Arabic LLM - Arabic MMLU Computer Science (Middle School) | 96.3 | Accuracy (%) | 96.3 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task | 94 | Accuracy (%) | 93.5 |
| Open Arabic LLM - Arabic MMLU Economics (Middle School) | 81.61 | Accuracy (%) | 92 |
| Open LLM Leaderboard - GPQA | 14.99 | Score | 91 |
Interactive version: theaggregate.ai/model?slug=lambda-qwen2-5-14b-dpo-test · How the rankings work · Data refreshed daily, snapshot 2026-07-22.