Qwen 2.5 14B Instruct — benchmark results

Alibaba Qwen 2.5 14B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1518 ± 9, rank #734 of 1776 rated models, from 285 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 555.29Score99.1
Open LLM Leaderboard - IFEval81.58Score98.7
MT-Bench PL - Math8.1Judge Score (0-10)98
Open Korean LLM Leaderboard768.68Average Score (%)97.6
Open CoT - LSAT Analytical Reasoning11.74CoT Gain (%)96.6
Finetuning with Scientific Data Increases Hall66.7OFS (self-reported)94.1
Open Japanese LLM - Wiki Coreference SET F19.69Score (%)93.8
OpenEval - BBQ92.59Exact Match (%)93.1
OpenEval - IFEval Strict86.11Strict Accuracy (%)92.9
SeaEval - Cultural Reasoning - SG-Eval (Zero-Shot)76.7Accuracy (%)92.9
French LLM Leaderboard - IFEval FR66.42Score (%)92.6
Open Arabic LLM - Aratrust Unfairness94.55Accuracy (%)91

Interactive version: theaggregate.ai/model?slug=qwen-2-5-14b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.