Codestral-22B-v0.1-abliterated-v3: benchmark results

Provider: Mistral. Access: Open.

Unified ELO 1462 ± 32, rank #1429 of 2656 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC56.47Accuracy (%)70.6
Open Chinese LLM - HellaSwag60.95Accuracy (%)60.1
Open Portuguese LLM - ENEM62.77Accuracy (%)53.4
Open Chinese LLM - ARC Challenge52.82Accuracy (%)51.3
Open Portuguese LLM - OAB Exams41.32Accuracy (%)46.6
Open Portuguese LLM - BLUEX49.37Accuracy (%)45
Open Chinese LLM - GSM8K43.67Accuracy (%)44.5
Open Portuguese LLM - ASSIN2 RTE88.26Macro F1 (%)44
Open Portuguese LLM - FaQuAD NLI56.61Macro F1 (%)39.1
Open Chinese LLM Leaderboard55.13Average Score (%)38
Open Chinese LLM - C-Eval Semantic64.46Accuracy (%)37.4
Open Chinese LLM - CMMLU47.66Accuracy (%)26.4

Interactive version: theaggregate.ai/model?slug=codestral-22b-v0-1-abliterated-v3 · How It Works · Data refreshed daily, snapshot 2026-09-19.