Qwen 1.5 110B Chat: benchmark results
Chat-tuned variant of Alibaba's 110B Qwen1.5 flagship (April 2024), roughly on par with Llama-3-70B-Instruct in chat evals. Provider: Alibaba. Released 2024-04-25. Access: Open.
Unified ELO 1538 ± 1, rank #495 of 1392 rated models, from 29 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MMLU-Pro | 42.5 | Score | 86.7 |
| Open LLM Leaderboard - BBH | 44.98 | Score | 85.3 |
| Open LLM Leaderboard - MuSR | 16.29 | Score | 85.3 |
| Open LLM Leaderboard - GPQA | 12.19 | Score | 84.9 |
| HREF | 40.76 | Average HREF Score (%) | 84.8 |
| MAGI-Hard | 66.09 | Accuracy (%, 2024-05 snapshot) | 84.5 |
| AlpacaEval 2.0 | 43.91 | LC Win Rate (%) | 83.3 |
| MathBench | 58.4 | Average Score | 81.8 |
| BenchBench | 74.2 | Aggregate Score (%) | 79.4 |
| Open LLM Leaderboard - MATH Level 5 | 23.41 | Score | 76.9 |
| Open LLM Leaderboard - IFEval | 59.39 | Score | 71.1 |
| BigCodeBench | 35 | Pass@1 (%) | 31 |
Interactive version: theaggregate.ai/model?slug=qwen-1-5-110b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.