Qwen 1.5 110B Chat — benchmark results
Chat-tuned variant of Alibaba's 110B Qwen1.5 flagship (April 2024), roughly on par with Llama-3-70B-Instruct in chat evals. Provider: Alibaba. Released 2024-04-25. Access: Open.
Unified ELO 1483 ± 19, rank #865 of 1776 rated models, from 30 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MMLU-Pro | 42.5 | Score | 86.7 |
| Open LLM Leaderboard - BBH | 44.98 | Score | 85.3 |
| Open LLM Leaderboard - MuSR | 16.29 | Score | 85.3 |
| Open LLM Leaderboard - GPQA | 12.19 | Score | 84.9 |
| HREF | 40.76 | Average HREF Score (%) | 84.8 |
| AlpacaEval 2.0 | 43.91 | LC Win Rate (%) | 83.3 |
| MathBench | 58.4 | Average Score | 81.8 |
| BenchBench | 74.2 | Aggregate Score (%) | 79.4 |
| LiveBench Cta | 54 | Score | 77.1 |
| Open LLM Leaderboard - MATH Level 5 | 23.41 | Score | 76.9 |
| Open LLM Leaderboard - IFEval | 59.39 | Score | 71.2 |
| LiveBench AMPS Hard | 23 | Score | 56.2 |
Interactive version: theaggregate.ai/model?slug=qwen-1-5-110b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.