Qwen2.5-14B-Instruct-1M — benchmark results

Alibaba's long-context variant of Qwen2.5 14B Instruct, extending input length to 1M tokens. Provider: Alibaba. Released 2025-01-27. Access: Open.

Unified ELO 1549 ± 23, rank #621 of 1776 rated models, from 78 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval84.14Score99.6
Open LLM Leaderboard - MATH Level 553.02Score98.2
EVALITA - text-entailment85.02CPS97.9
RULER95.7Avg Accuracy (%)95
Open Japanese LLM - CG63.86Score (%)94.8
Open Japanese LLM - Jsick Exact Match84.84Score (%)90.4
EVALITA - relation-extraction44.23CPS89.4
Open Japanese LLM - Jsts Spearman87.81Score (%)88.7
Open Japanese LLM - Wiki Dependency SET F141.23Score (%)88.2
Open Japanese LLM - Mbpp Pylint Check95.78Score (%)87
Open LLM Leaderboard - MMLU-Pro42.77Score86.8
Open LLM Leaderboard - BBH45.66Score85.8

Interactive version: theaggregate.ai/model?slug=qwen2-5-14b-instruct-1m · How the rankings work · Data refreshed daily, snapshot 2026-07-22.