Qwen 2.5 14B — benchmark results
Alibaba's open 14B Qwen2.5 mid-size model with a 128K context and improved coding, math, and structured output. Provider: Alibaba. Released 2024-09-19. Access: Open.
Unified ELO 1547 ± 12, rank #627 of 1776 rated models, from 218 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Arabic LLM - Arabic MMLU Geography (Middle School) | 75 | Accuracy (%) | 98.1 |
| Open Arabic LLM - Arabic MMLU Philosophy (High School) | 71.79 | Accuracy (%) | 97.5 |
| Open Arabic LLM - Arabic MMLU HT Virology | 53.01 | Accuracy (%) | 96.6 |
| Open Arabic LLM - Arabic MMLU Computer Science (Middle School) | 96.3 | Accuracy (%) | 96.3 |
| Open LLM Leaderboard - GPQA | 17.56 | Score | 95.3 |
| Open Arabic LLM - Arabic MMLU General Knowledge (Primary School) | 77.78 | Accuracy (%) | 93.5 |
| Open Arabic LLM - Arabic MMLU History (High School) | 53.42 | Accuracy (%) | 92.6 |
| Open Arabic LLM - Arabic MMLU Accounting (University) | 70.27 | Accuracy (%) | 92.3 |
| Open Arabic LLM - Arabic MMLU Natural Science (Primary School) | 88.99 | Accuracy (%) | 91.4 |
| Open LLM Leaderboard - MMLU-Pro | 47.21 | Score | 91.1 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task | 81.53 | Accuracy (%) | 90.7 |
| Open Arabic LLM - Arabic MMLU Civics (Middle School) | 60.59 | Accuracy (%) | 90.7 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.