Qwen 2 57B A14B — benchmark results

Alibaba's 57B mixture-of-experts Qwen2 with 14B active per token, delivering roughly 30B-dense performance at lower compute (June 2024). Provider: Alibaba. Released 2024-06-06. Access: Open.

Unified ELO 1508 ± 26, rank #770 of 1776 rated models, from 65 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Japanese LLM - SUM12.17Score (%)92.5
Open Japanese LLM - Xlsum JA Bert Score JA F170.97Score (%)91.6
Open Japanese LLM - Xlsum JA Rouge133.43Score (%)91.6
Open Japanese LLM - Xlsum JA RougeLsum28.16Score (%)91.3
Open Japanese LLM - Xlsum JA Rouge212.18Score (%)90.9
Open Chinese LLM - GSM8K64.9Accuracy (%)89.3
Open LLM Leaderboard - MMLU-Pro43.51Score87.3
Open Chinese LLM - C-Eval Semantic87.95Accuracy (%)86.9
Open Chinese LLM - WinoGrande67.88Accuracy (%)85.2
Open Chinese LLM Leaderboard66.47Average Score (%)84.3
Open Chinese LLM - HellaSwag67.77Accuracy (%)84
Open Chinese LLM - CMMLU68.97Accuracy (%)81.6

Interactive version: theaggregate.ai/model?slug=qwen-2-57b-a14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.