Qwen 1.5 14B Chat — benchmark results

Chat-tuned Qwen1.5 14B checkpoint. Provider: Alibaba. Released 2024-02-05. Access: Open.

Unified ELO 1425 ± 12, rank #1106 of 1776 rated models, from 185 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenEval - BBQ93.49Exact Match (%)96.6
Open Korean LLM Leaderboard573.14Average Score (%)92.5
EuroEval Portuguese NLU - MultiWikiQA PT75.98Reading comprehension Score (%)88.5
Open Chinese LLM - GSM8K59.06Accuracy (%)82.6
Open Chinese LLM - HellaSwag65.16Accuracy (%)78.6
EuroEval Swedish NLU - Swerec77.66Sentiment classification Score (%)78.2
EuroEval Portuguese NLU - ScaLA PT23.99Linguistic acceptability Score (%)77.5
EuroEval German NLU - Sb10K55.97Sentiment classification Score (%)77.2
Open Chinese LLM Leaderboard63.79Average Score (%)77.2
EuroEval Portuguese NLU55.66NLU Average Score (%)76.7
Open LLM Leaderboard - MuSR13.93Score76.5
Open Japanese LLM - Xlsum JA Rouge129.25Score (%)76.4

Interactive version: theaggregate.ai/model?slug=qwen-1-5-14b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.