Qwen 1.5 1.8B Chat — benchmark results
Provider: Alibaba. Released 2024-02-05. Access: Open.
Unified ELO 1185 ± 19, rank #1705 of 1776 rated models, from 113 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 12.18 | Score | 66.2 |
| Open LLM Leaderboard - GPQA | 6.38 | Score | 53.5 |
| RewardBench Chat Hard | 60.31 | Accuracy (%) | 46.9 |
| RewardBench Reasoning | 77.93 | Accuracy (%) | 45.6 |
| OpenEval - GPQA CoT | 17.94 | CoT Correctness (%) | 45.2 |
| OpenEval - MMLU-Pro CoT | 7.82 | CoT Correctness (%) | 35.7 |
| OpenEval - Omni-MATH | 2.24 | Accuracy (%) | 35 |
| EuroEval Portuguese NLU - MultiWikiQA PT | 54.92 | Reading comprehension Score (%) | 30.9 |
| EuroEval English Knowledge | 44.42 | Knowledge Average Score (%) | 28.9 |
| EuroEval Norwegian Common Sense Reasoning | 15.29 | Common Sense Reasoning Average Score (%) | 28.5 |
| EuroEval Danish Knowledge | 17.4 | Knowledge Average Score (%) | 27.3 |
| EuroEval Portuguese NLU - ScaLA PT | 2.42 | Linguistic acceptability Score (%) | 26.8 |
Interactive version: theaggregate.ai/model?slug=qwen-1-5-1-8b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.