Claude 2.1: benchmark results

Anthropic Claude 2.1 legacy chat model. Provider: Anthropic. Released 2023-11-21. Access: API.

Unified ELO 1447 ± 1, rank #958 of 1392 rated models, from 39 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
T-Eval78.8Overall Score (%)90
CZ-EVAL - Verbal63.36Accuracy (%)81.8
CZ-EVAL - Analytical38.04Accuracy (%)72.7
BenchBench66.94Aggregate Score (%)72.1
HELM WMT 201420.43BLEU-4 (%)65
HELM v2 Lite - LegalBench60.11Exact Match (%)65
HELM v2 Lite - MedQA69.23Exact Match (%)65
MMLU73.5Accuracy (%)64.8
CZ-EVAL - Critical Thinking64.5Accuracy (%)63.6
CZ-EVAL - Klokan (Math)38.24Accuracy (%)63.6
AlpacaEval 1.087.08Win Rate (%)61.4
AlpacaEval 2.025.25LC Win Rate (%)59.9

Interactive version: theaggregate.ai/model?slug=claude-2-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.