Qwen 1.5 1.8B Chat — benchmark results

Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1185 ± 19, rank #1705 of 1776 rated models, from 113 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR12.18Score66.2
Open LLM Leaderboard - GPQA6.38Score53.5
RewardBench Chat Hard60.31Accuracy (%)46.9
RewardBench Reasoning77.93Accuracy (%)45.6
OpenEval - GPQA CoT17.94CoT Correctness (%)45.2
OpenEval - MMLU-Pro CoT7.82CoT Correctness (%)35.7
OpenEval - Omni-MATH2.24Accuracy (%)35
EuroEval Portuguese NLU - MultiWikiQA PT54.92Reading comprehension Score (%)30.9
EuroEval English Knowledge44.42Knowledge Average Score (%)28.9
EuroEval Norwegian Common Sense Reasoning15.29Common Sense Reasoning Average Score (%)28.5
EuroEval Danish Knowledge17.4Knowledge Average Score (%)27.3
EuroEval Portuguese NLU - ScaLA PT2.42Linguistic acceptability Score (%)26.8

Interactive version: theaggregate.ai/model?slug=qwen-1-5-1-8b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.