WizardLM-2 8x22B: benchmark results

Microsoft's Mixtral-8x22B finetune briefly pulled days after its April 2024 release over missing toxicity testing, surviving via community mirrors. Provider: Microsoft. Released 2024-04-15. Access: Open.

Unified ELO 1511 ± 1, rank #644 of 1392 rated models, from 52 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - GPQA17.56Score95.3
LogicKor - Reasoning8.5Score (0-10)89.1
Open Chinese LLM - GSM8K64.82Accuracy (%)89
Open LLM Leaderboard - BBH48.58Score88.9
LogicKor - Single-Turn8.52Score (0-10)87.2
LogicKor - Writing9.35Score (0-10)85.7
Open LLM Leaderboard - MMLU-Pro39.96Score84.9
LogicKor - Coding9.28Score (0-10)84.5
LogicKor8.13Score (0-10)83.2
Open PL LLM - Generative66.42Average Generative Score (%)82.2
Open PL LLM Leaderboard62.35Average Score (%)80.4
LogicKor - Multi-Turn7.73Score (0-10)80

Interactive version: theaggregate.ai/model?slug=wizardlm-2-8x22b · How It Works · Data refreshed daily, snapshot 2026-09-05.