Qwen 1.5 14B — benchmark results
Alibaba's 14B Qwen1.5 base model (February 2024) with 32K context, released under the Tongyi Qianwen license rather than Apache 2.0. Provider: Alibaba. Released 2024-02-05. Access: Open.
Unified ELO 1444 ± 10, rank #1027 of 1776 rated models, from 282 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM NaturalQuestions (Open) | 77.21 | F1 (%) | 85.6 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task | 80.28 | Accuracy (%) | 84 |
| Open Chinese LLM - WinoGrande | 66.38 | Accuracy (%) | 77.9 |
| Open Japanese LLM - Mbpp Pylint Check | 90.76 | Score (%) | 77.9 |
| Open Chinese LLM - C-Eval Semantic | 85.04 | Accuracy (%) | 76.9 |
| Open Chinese LLM - GSM8K | 55.8 | Accuracy (%) | 76.9 |
| Open Korean LLM Leaderboard | 386.7 | Average Score (%) | 75.4 |
| EuroEval Swedish NLU - Swerec | 77.2 | Sentiment classification Score (%) | 73.4 |
| Open Chinese LLM Leaderboard | 61.65 | Average Score (%) | 73.3 |
| Open Japanese LLM - Wiki NER SET F1 | 8.85 | Score (%) | 72 |
| Open LLM Leaderboard - MATH Level 5 | 20.24 | Score | 71.3 |
| Open Chinese LLM - CMMLU | 61.12 | Accuracy (%) | 70.3 |
Interactive version: theaggregate.ai/model?slug=qwen-1-5-14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.