Qwen 2.5 14B — benchmark results

Alibaba's open 14B Qwen2.5 mid-size model with a 128K context and improved coding, math, and structured output. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1547 ± 12, rank #627 of 1776 rated models, from 218 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Arabic LLM - Arabic MMLU Geography (Middle School)75Accuracy (%)98.1
Open Arabic LLM - Arabic MMLU Philosophy (High School)71.79Accuracy (%)97.5
Open Arabic LLM - Arabic MMLU HT Virology53.01Accuracy (%)96.6
Open Arabic LLM - Arabic MMLU Computer Science (Middle School)96.3Accuracy (%)96.3
Open LLM Leaderboard - GPQA17.56Score95.3
Open Arabic LLM - Arabic MMLU General Knowledge (Primary School)77.78Accuracy (%)93.5
Open Arabic LLM - Arabic MMLU History (High School)53.42Accuracy (%)92.6
Open Arabic LLM - Arabic MMLU Accounting (University)70.27Accuracy (%)92.3
Open Arabic LLM - Arabic MMLU Natural Science (Primary School)88.99Accuracy (%)91.4
Open LLM Leaderboard - MMLU-Pro47.21Score91.1
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task81.53Accuracy (%)90.7
Open Arabic LLM - Arabic MMLU Civics (Middle School)60.59Accuracy (%)90.7

Interactive version: theaggregate.ai/model?slug=qwen-2-5-14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.