Qwen 1.5 7B — benchmark results
Alibaba's 7B model from the Qwen1.5 series (February 2024), adding 32K context and stronger multilingual performance over the original Qwen. Provider: Alibaba. Released 2024-02-05. Access: Open.
Unified ELO 1406 ± 7, rank #1194 of 1776 rated models, from 214 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM NaturalQuestions (Open) | 74.92 | F1 (%) | 75.6 |
| Open Chinese LLM - WinoGrande | 65.19 | Accuracy (%) | 71.5 |
| Open Chinese LLM - C-Eval Semantic | 75.21 | Accuracy (%) | 65.3 |
| Open Arabic LLM - Aratrust Offensive | 84.06 | Accuracy (%) | 63.4 |
| Open Arabic LLM - Arabic MMLU Accounting (University) | 55.41 | Accuracy (%) | 59 |
| Open Chinese LLM - CMMLU | 54.71 | Accuracy (%) | 58.2 |
| CMMLU | 72.5 | 5-shot Avg Accuracy (%) | 57.5 |
| Open Japanese LLM - Xlsum JA Rouge1 | 26.65 | Score (%) | 57 |
| Open LLM Leaderboard - GPQA | 6.49 | Score | 54.5 |
| Open Japanese LLM - Xlsum JA RougeLsum | 22.37 | Score (%) | 53.6 |
| Open Arabic LLM - Arabic MMLU Arabic Language (Grammar) | 34.79 | Accuracy (%) | 53.1 |
| Open Arabic LLM - Arabic MMLU Management (University) | 68 | Accuracy (%) | 51.5 |
Interactive version: theaggregate.ai/model?slug=qwen-1-5-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.