Qwen 3 14B: benchmark results

Alibaba's open Qwen 3 14B dense model with hybrid thinking (April 2025). Provider: Alibaba. Released 2025-04-28. Access: Open.

Unified ELO 1536 ± 1, rank #505 of 1392 rated models, from 518 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AgingBench7.9S1 kw_m HL (self-reported)100
AppWorld Challenge67.6Task Goal Completion (%)100
AppWorld Normal86.9Task Goal Completion (%)100
ChLogic99.13English (self-reported)100
AGC-Bench - unfun_corpus1.44Dataset z-score98.7
INCLUDE-base-44 European Languages63.03Average Accuracy (%)97.1
EuroEval German NLU - GermEval73.49Named entity recognition Score (%)95.7
EuroEval Lithuanian58.25Average Score (%)95.2
EuroEval Lithuanian NLU55.05NLU Average Score (%)95.2
Open-R1 Eval Leaderboard72.67Average Accuracy (%)94.4
AGC-Bench - showerthoughts1.08Dataset z-score93.8
MERA Code - ruHumanEval77.5pass@1 (%)93.8

Interactive version: theaggregate.ai/model?slug=qwen-3-14b · How It Works · Data refreshed daily, snapshot 2026-09-05.