Qwen 1.5 110B — benchmark results

Alibaba's first 100B+ open-weights Qwen release (April 2024), a 110B dense base model with GQA and 32K context. Provider: Alibaba. Released 2024-04-25. Access: Open.

Unified ELO 1491 ± 23, rank #833 of 1776 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MMLU-Pro48.45Score94
Open LLM Leaderboard - GPQA13.65Score88.6
CMMLU88.325-shot Avg Accuracy (%)87.5
Open LLM Leaderboard - BBH44.28Score84.6
Open LLM Leaderboard - MATH Level 524.7Score77.8
Open LLM Leaderboard - MuSR13.71Score75.4
HELM NaturalQuestions (Open)73.95F1 (%)70
HELM Lite59.84Mean win rate (self-reported)67.5
SynthPAI65.7Average accuracy in %64.7
HELM (Stanford)54.96Mean Win Rate (%)60
ASCIIEval30.28Macro-Avg Accuracy (%)52.8
HELM WMT 201419.24BLEU-4 (%)52.2

Interactive version: theaggregate.ai/model?slug=qwen-1-5-110b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.