Qwen 1.5 14B Chat: benchmark results

Chat-tuned Qwen1.5 14B checkpoint. Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1460 ± 1, rank #897 of 1392 rated models, from 206 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenEval - BBQ93.49Exact Match (%)90.9
EuroEval Portuguese NLU - MultiWikiQA PT75.98Reading comprehension Score (%)88.5
Open Korean LLM Leaderboard42.59Average Score (%)83.7
Open Chinese LLM - GSM8K59.06Accuracy (%)82.6
Open Chinese LLM - HellaSwag65.16Accuracy (%)78.6
EuroEval Swedish NLU - Swerec77.66Sentiment classification Score (%)78.2
EuroEval Portuguese NLU - ScaLA PT23.99Linguistic acceptability Score (%)77.5
EuroEval German NLU - Sb10K55.97Sentiment classification Score (%)77.2
Open Chinese LLM Leaderboard63.79Average Score (%)77.2
Open Japanese LLM - Xlsum JA Rouge129.25Score (%)76.9
EuroEval Portuguese NLU55.66NLU Average Score (%)76.7
Open LLM Leaderboard - MuSR13.93Score76.5

Interactive version: theaggregate.ai/model?slug=qwen-1-5-14b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.