Claude 3.5 Sonnet (20241022): benchmark results

October 22, 2024 Claude 3.5 Sonnet snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2024-10-22. Access: API.

Unified ELO 1600 ± 1, rank #264 of 1392 rated models, from 1031 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Aider Refactoring Benchmark92.1Percent completed correctly (self-reported)100
BALROG BabyAI (VLM)82Progress (%)100
BALROG MiniHack (VLM)22.5Progress (%)100
HELM MedHELM - MedAlign4.26Jury Score100
HELM MedHELM - MedHallu92.6EM100
MEGA-Bench Task - AV View Identification33.3Task Score (%)100
MEGA-Bench Task - Ball Cup Swap 364.3Task Score (%)100
MEGA-Bench Task - Code Translation Easy78.6Task Score (%)100
MEGA-Bench Task - Constrained Generation Contain Repeat Length46.7Task Score (%)100
MEGA-Bench Task - Counting85.7Task Score (%)100
MEGA-Bench Task - Doc VQA92.5Task Score (%)100
MEGA-Bench Task - Geometry Reasoning Circled Letter96.4Task Score (%)100

Interactive version: theaggregate.ai/model?slug=claude-3-5-sonnet-20241022 · How It Works · Data refreshed daily, snapshot 2026-09-05.