Claude 2.1 — benchmark results

Anthropic Claude 2.1 legacy chat model. Provider: Anthropic. Released 2023-11-21. Access: API.

Unified ELO 1422 ± 19, rank #1120 of 1776 rated models, from 42 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
T-Eval78.8Overall Score (%)90
CZ-EVAL - Verbal63.36Accuracy (%)81.8
CZ-EVAL - Analytical38.04Accuracy (%)72.7
BenchBench66.94Aggregate Score (%)72.1
HELM WMT 201420.43BLEU-4 (%)65
HELM v2 Lite - LegalBench60.11Exact Match (%)65
HELM v2 Lite - MedQA69.23Exact Match (%)65
MMLU73.5Accuracy (%)64.8
CZ-EVAL - Critical Thinking64.5Accuracy (%)63.6
CZ-EVAL - Klokan (Math)38.24Accuracy (%)63.6
AlpacaEval 1.087.08Win Rate (%)61.4
AlpacaEval 2.025.25LC Win Rate (%)59.9

Interactive version: theaggregate.ai/model?slug=claude-2-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.