Qwen 1.5 1.8B Chat: benchmark results
Provider: Alibaba. Released 2024-02-05. Access: Open.
Unified ELO 1318 ± 1, rank #1328 of 1392 rated models, from 120 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 12.18 | Score | 66.2 |
| Open LLM Leaderboard - GPQA | 6.38 | Score | 53.5 |
| RewardBench Chat Hard | 60.31 | Accuracy (%) | 46.9 |
| RewardBench Reasoning | 77.93 | Accuracy (%) | 45.6 |
| MERA - RWSD | 55 | Accuracy (%) | 43.1 |
| EuroEval Portuguese NLU - MultiWikiQA PT | 54.92 | Reading comprehension Score (%) | 30.9 |
| EuroEval English Knowledge | 44.42 | Knowledge Average Score (%) | 28.9 |
| EuroEval Norwegian Common Sense Reasoning | 15.29 | Common Sense Reasoning Average Score (%) | 28.5 |
| EuroEval Danish Knowledge | 17.4 | Knowledge Average Score (%) | 27.3 |
| EuroEval Portuguese NLU - ScaLA PT | 2.42 | Linguistic acceptability Score (%) | 26.8 |
| EuroEval Dutch NLU - DBRD | 67.06 | Sentiment classification Score (%) | 25.6 |
| EuroEval Norwegian Knowledge | 4.29 | Knowledge Average Score (%) | 25.3 |
Interactive version: theaggregate.ai/model?slug=qwen-1-5-1-8b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.