Qwen 2 57B A14B Instruct: benchmark results

Alibaba's Apache-2.0 MoE instruct model from Qwen2 (June 2024) with 57B total and 14B active parameters and 64K context. Provider: Alibaba. Released 2024-06-04. Access: Open.

Unified ELO 1518 ± 1, rank #610 of 1392 rated models, from 107 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - GSM8K69.29Accuracy (%)94.2
Open Chinese LLM Leaderboard68.71Average Score (%)92.9
Open Chinese LLM - WinoGrande70.01Accuracy (%)91.5
Enkrypt AI - Safety Risk18.97Risk Score88.5
Open Chinese LLM - C-Eval Semantic88.44Accuracy (%)88.1
Open Chinese LLM - HellaSwag68.48Accuracy (%)88.1
Open Chinese LLM - ARC Challenge59.47Accuracy (%)84.7
Open LLM Leaderboard - MMLU-Pro39.73Score84.7
Open Chinese LLM - CMMLU69.03Accuracy (%)81.9
MERA - PARus91.6Accuracy (%)81.1
Open LLM Leaderboard - GPQA10.85Score81
Open LLM Leaderboard - BBH41.79Score80.9

Interactive version: theaggregate.ai/model?slug=qwen-2-57b-a14b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.