wizardlm-13B: benchmark results
Provider: Microsoft. Released 2023-05-13. Access: Open.
Unified ELO 1397 ± 20, rank #1927 of 2656 rated models, from 27 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MoralChoice | 99.1 | MoralChoice Acc (%) | 62.5 |
| MT-Bench | 6.35 | MT-Bench average score (points) | 54.5 |
| BenchBench | 42.77 | Aggregate Score (%) | 44.1 |
| AlpacaEval | 62.55 | Length-Controlled Win Rate (%) | 42.1 |
| T-Eval | 49 | Overall Score (%) | 40 |
| AlpacaEval 1.0 | 75.31 | Win Rate (%) | 32.7 |
| AlpacaEval 2.0 | 9.83 | LC Win Rate (%) | 21.6 |
| Chatbot Arena (Text - Writing, Literature & Language) | 1153 | Arena Score | 13.4 |
| Chatbot Arena (Text - Creative Writing) | 1140 | Arena Score | 13.3 |
| Chatbot Arena (Text - Entertainment, Sports & Media) | 1140 | Arena Score | 12.7 |
| Chatbot Arena (Text - Non-English) | 1106 | Arena Score | 11.1 |
| Chatbot Arena (Text - Instruction Following) | 1124 | Arena Score | 9.9 |
Interactive version: theaggregate.ai/model?slug=wizardlm-13b · How It Works · Data refreshed daily, snapshot 2026-09-19.