Qwen 2 57B A14B — benchmark results
Alibaba's 57B mixture-of-experts Qwen2 with 14B active per token, delivering roughly 30B-dense performance at lower compute (June 2024). Provider: Alibaba. Released 2024-06-06. Access: Open.
Unified ELO 1508 ± 26, rank #770 of 1776 rated models, from 65 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Japanese LLM - SUM | 12.17 | Score (%) | 92.5 |
| Open Japanese LLM - Xlsum JA Bert Score JA F1 | 70.97 | Score (%) | 91.6 |
| Open Japanese LLM - Xlsum JA Rouge1 | 33.43 | Score (%) | 91.6 |
| Open Japanese LLM - Xlsum JA RougeLsum | 28.16 | Score (%) | 91.3 |
| Open Japanese LLM - Xlsum JA Rouge2 | 12.18 | Score (%) | 90.9 |
| Open Chinese LLM - GSM8K | 64.9 | Accuracy (%) | 89.3 |
| Open LLM Leaderboard - MMLU-Pro | 43.51 | Score | 87.3 |
| Open Chinese LLM - C-Eval Semantic | 87.95 | Accuracy (%) | 86.9 |
| Open Chinese LLM - WinoGrande | 67.88 | Accuracy (%) | 85.2 |
| Open Chinese LLM Leaderboard | 66.47 | Average Score (%) | 84.3 |
| Open Chinese LLM - HellaSwag | 67.77 | Accuracy (%) | 84 |
| Open Chinese LLM - CMMLU | 68.97 | Accuracy (%) | 81.6 |
Interactive version: theaggregate.ai/model?slug=qwen-2-57b-a14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.