Qwen 1.5 1.8B Chat: benchmark results

Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1318 ± 1, rank #1328 of 1392 rated models, from 120 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR12.18Score66.2
Open LLM Leaderboard - GPQA6.38Score53.5
RewardBench Chat Hard60.31Accuracy (%)46.9
RewardBench Reasoning77.93Accuracy (%)45.6
MERA - RWSD55Accuracy (%)43.1
EuroEval Portuguese NLU - MultiWikiQA PT54.92Reading comprehension Score (%)30.9
EuroEval English Knowledge44.42Knowledge Average Score (%)28.9
EuroEval Norwegian Common Sense Reasoning15.29Common Sense Reasoning Average Score (%)28.5
EuroEval Danish Knowledge17.4Knowledge Average Score (%)27.3
EuroEval Portuguese NLU - ScaLA PT2.42Linguistic acceptability Score (%)26.8
EuroEval Dutch NLU - DBRD67.06Sentiment classification Score (%)25.6
EuroEval Norwegian Knowledge4.29Knowledge Average Score (%)25.3

Interactive version: theaggregate.ai/model?slug=qwen-1-5-1-8b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.