Qwen 2.5 14B Instruct: benchmark results

Alibaba Qwen 2.5 14B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1514 ± 1, rank #627 of 1392 rated models, from 343 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 555.29Score99.1
Open Korean LLM Leaderboard51.51Average Score (%)98.8
Open LLM Leaderboard - IFEval81.58Score98.7
MT-Bench PL - Math8.1Judge Score (0-10)98
Open CoT - LSAT Analytical Reasoning11.74CoT Gain (%)96.6
Thai LLM - Math7.9Rating (0-10)94.4
Finetuning with Scientific Data Increases Hall66.7OFS (self-reported)94.1
Open Japanese LLM - Wiki Coreference SET F19.69Score (%)93.8
SeaEval - Cultural Reasoning - SG-Eval (Zero-Shot)76.7Accuracy (%)92.9
French LLM Leaderboard - IFEval FR66.42Score (%)92.6
Thai LLM NLU - wisesight_thai_sentiment_seacrowd_text52.68Accuracy (%)91.3
Open Arabic LLM - Aratrust Unfairness94.55Accuracy (%)91

Interactive version: theaggregate.ai/model?slug=qwen-2-5-14b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.