Qwen 1.5 4B Chat — benchmark results

Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1287 ± 16, rank #1558 of 1776 rated models, from 114 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SALAD-Bench59.43Average Safety Score (%)78.8
SALAD-Bench Attack23.34Safety Score (%)75.8
EuroEval Portuguese NLU - MultiWikiQA PT73.03Reading comprehension Score (%)74.4
SALAD-Bench Base95.51Safety Score (%)72.7
OpenEval - BBQ62.86Exact Match (%)62.1
RewardBench Chat Hard62.72Accuracy (%)53.7
Open Chinese LLM - WinoGrande63.14Accuracy (%)53.6
OpenEval - Omni-MATH6.34Accuracy (%)50
OpenEval - GPQA CoT20.85CoT Correctness (%)47.6
OpenEval - MMLU-Pro CoT14.04CoT Correctness (%)47.6
EuroEval Portuguese NLU - ScaLA PT11.18Linguistic acceptability Score (%)46.8
Open Japanese LLM - Wiki NER SET F14.42Score (%)45.8

Interactive version: theaggregate.ai/model?slug=qwen-1-5-4b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.