Claude 2.1 — benchmark results
Anthropic Claude 2.1 legacy chat model. Provider: Anthropic. Released 2023-11-21. Access: API.
Unified ELO 1422 ± 19, rank #1120 of 1776 rated models, from 42 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| T-Eval | 78.8 | Overall Score (%) | 90 |
| CZ-EVAL - Verbal | 63.36 | Accuracy (%) | 81.8 |
| CZ-EVAL - Analytical | 38.04 | Accuracy (%) | 72.7 |
| BenchBench | 66.94 | Aggregate Score (%) | 72.1 |
| HELM WMT 2014 | 20.43 | BLEU-4 (%) | 65 |
| HELM v2 Lite - LegalBench | 60.11 | Exact Match (%) | 65 |
| HELM v2 Lite - MedQA | 69.23 | Exact Match (%) | 65 |
| MMLU | 73.5 | Accuracy (%) | 64.8 |
| CZ-EVAL - Critical Thinking | 64.5 | Accuracy (%) | 63.6 |
| CZ-EVAL - Klokan (Math) | 38.24 | Accuracy (%) | 63.6 |
| AlpacaEval 1.0 | 87.08 | Win Rate (%) | 61.4 |
| AlpacaEval 2.0 | 25.25 | LC Win Rate (%) | 59.9 |
Interactive version: theaggregate.ai/model?slug=claude-2-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.