Qwen 1.5 4B Chat: benchmark results

Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1361 ± 1, rank #1242 of 1392 rated models, from 132 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SALAD-Bench59.43Average Safety Score (%)78.8
SALAD-Bench Attack23.34Safety Score (%)75.8
EuroEval Portuguese NLU - MultiWikiQA PT73.03Reading comprehension Score (%)74.4
SALAD-Bench Base95.51Safety Score (%)72.7
RewardBench Chat Hard62.72Accuracy (%)53.7
Open Chinese LLM - WinoGrande63.14Accuracy (%)53.6
MERA - RWSD55.77Accuracy (%)48.1
EuroEval Portuguese NLU - ScaLA PT11.18Linguistic acceptability Score (%)46.8
Open Japanese LLM - Wiki NER SET F14.42Score (%)45.8
EuroEval Portuguese NLU47.25NLU Average Score (%)43.2
EuroEval Norwegian Common Sense Reasoning36.81Common Sense Reasoning Average Score (%)41.4
OpenEval - BBQ62.86Exact Match (%)40.9

Interactive version: theaggregate.ai/model?slug=qwen-1-5-4b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.