Qwen-14B — benchmark results
Provider: Alibaba. Released 2023-09-25. Access: Open.
Unified ELO 1362 ± 20, rank #1371 of 1776 rated models, from 18 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ARC Challenge (AI2) | 84.4 | Accuracy (%) | 80.8 |
| BoolQ | 86.2 | Accuracy (%) | 76.6 |
| T-Eval | 66.3 | Overall Score (%) | 75 |
| InfiBench | 43.69 | Score (%) | 69.5 |
| GSM8K | 61.3 | Accuracy (%) | 64.9 |
| EvoEval Difficult | 23 | Pass@1 (%) | 56 |
| Big-Bench Hard | 53.4 | Average (%) | 54.2 |
| EvoEval Combine | 13 | Pass@1 (%) | 54 |
| MMLU | 66.3 | Accuracy (%) | 44.4 |
| EvoEval Verbose | 48.78 | Pass@1 (%) | 44 |
| EvoEval Subtle | 45 | Pass@1 (%) | 42 |
| EvoEval Tool Use | 45 | Pass@1 (%) | 39 |
Interactive version: theaggregate.ai/model?slug=qwen-14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.