Claude Sonnet 5 (Medium): benchmark results

Provider: Anthropic. Released 2026-06-30. Access: API.

Unified ELO 1628 ± 1, rank #328 of 1761 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Korean LLM Eval - KMMLU-Pro85.83Accuracy (%, 0-shot)71.4
Korean LLM Eval - CLIcK92.08Accuracy (%, 0-shot)57.1
Korean LLM Eval - KMMLU-HARD77.44Accuracy (%, 0-shot)57.1
Surface Evolver Bench60Mean Score (%)56
DuelLab Overall40.9DuelLab Score51.4
Korean LLM Eval - KoBALT-70076.14Accuracy (%, 0-shot)42.9
Korean LLM Eval - MuSR (Ko)81.6Accuracy (%, 0-shot)42.9
Surface Evolver Bench Pass Rate18.75Pass Rate (%)32
Korean LLM Eval - HAE-RAE Bench92Accuracy (%, 0-shot)28.6
CursorBench 3.152.4Score (%)24.7
DeepsecBench5.81Recall-weighted F2 score (%)11.4
DataBench56Score (%)9.7

Interactive version: theaggregate.ai/model?slug=claude-sonnet-5-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.