Qwen 1.5 72B Chat: benchmark results

Alibaba's 72B Qwen1.5 chat model (February 2024) with 32K context and strong multilingual coverage. Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1496 ± 1, rank #707 of 1392 rated models, from 50 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - C-Eval Semantic91.14Accuracy (%)98.2
Open Chinese LLM - HellaSwag72.16Accuracy (%)96.4
Open Chinese LLM Leaderboard68.83Average Score (%)93.2
Open Chinese LLM - ARC Challenge62.12Accuracy (%)91.8
Open Chinese LLM - CMMLU70.92Accuracy (%)89.3
Open Chinese LLM - WinoGrande68.9Accuracy (%)88.3
BiGGen-Bench3.83Average Score (1-5)85.3
Open Chinese LLM - GSM8K59.67Accuracy (%)83.7
Open PL LLM - Multiple Choice58.92Average Multiple-Choice Score (%)81.3
MAGI-Hard63.47Accuracy (%, 2024-05 snapshot)79.3
AlpacaEval 2.036.57LC Win Rate (%)76.6
Open PL LLM Leaderboard58.67Average Score (%)74.5

Interactive version: theaggregate.ai/model?slug=qwen-1-5-72b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.