Qwen 1.5 7B — benchmark results

Alibaba's 7B model from the Qwen1.5 series (February 2024), adding 32K context and stronger multilingual performance over the original Qwen. Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1406 ± 7, rank #1194 of 1776 rated models, from 214 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM NaturalQuestions (Open)74.92F1 (%)75.6
Open Chinese LLM - WinoGrande65.19Accuracy (%)71.5
Open Chinese LLM - C-Eval Semantic75.21Accuracy (%)65.3
Open Arabic LLM - Aratrust Offensive84.06Accuracy (%)63.4
Open Arabic LLM - Arabic MMLU Accounting (University)55.41Accuracy (%)59
Open Chinese LLM - CMMLU54.71Accuracy (%)58.2
CMMLU72.55-shot Avg Accuracy (%)57.5
Open Japanese LLM - Xlsum JA Rouge126.65Score (%)57
Open LLM Leaderboard - GPQA6.49Score54.5
Open Japanese LLM - Xlsum JA RougeLsum22.37Score (%)53.6
Open Arabic LLM - Arabic MMLU Arabic Language (Grammar)34.79Accuracy (%)53.1
Open Arabic LLM - Arabic MMLU Management (University)68Accuracy (%)51.5

Interactive version: theaggregate.ai/model?slug=qwen-1-5-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.