Qwen2.5-14B-Instruct-1M — benchmark results
Alibaba's long-context variant of Qwen2.5 14B Instruct, extending input length to 1M tokens. Provider: Alibaba. Released 2025-01-27. Access: Open.
Unified ELO 1549 ± 23, rank #621 of 1776 rated models, from 78 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 84.14 | Score | 99.6 |
| Open LLM Leaderboard - MATH Level 5 | 53.02 | Score | 98.2 |
| EVALITA - text-entailment | 85.02 | CPS | 97.9 |
| RULER | 95.7 | Avg Accuracy (%) | 95 |
| Open Japanese LLM - CG | 63.86 | Score (%) | 94.8 |
| Open Japanese LLM - Jsick Exact Match | 84.84 | Score (%) | 90.4 |
| EVALITA - relation-extraction | 44.23 | CPS | 89.4 |
| Open Japanese LLM - Jsts Spearman | 87.81 | Score (%) | 88.7 |
| Open Japanese LLM - Wiki Dependency SET F1 | 41.23 | Score (%) | 88.2 |
| Open Japanese LLM - Mbpp Pylint Check | 95.78 | Score (%) | 87 |
| Open LLM Leaderboard - MMLU-Pro | 42.77 | Score | 86.8 |
| Open LLM Leaderboard - BBH | 45.66 | Score | 85.8 |
Interactive version: theaggregate.ai/model?slug=qwen2-5-14b-instruct-1m · How the rankings work · Data refreshed daily, snapshot 2026-07-22.