Claude 3.5 Sonnet (20241022) — benchmark results

October 22, 2024 Claude 3.5 Sonnet snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2024-10-22. Access: API.

Unified ELO 1645 ± 7, rank #382 of 1776 rated models, from 1011 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM MedHELM - MedAlign4.26Jury Score100
HELM MedHELM - MedHallu92.6EM100
MEGA-Bench Task - AV View Identification33.3Task Score (%)100
MEGA-Bench Task - Ball Cup Swap 364.3Task Score (%)100
MEGA-Bench Task - Code Translation Easy78.6Task Score (%)100
MEGA-Bench Task - Constrained Generation Contain Repeat Length46.7Task Score (%)100
MEGA-Bench Task - Counting85.7Task Score (%)100
MEGA-Bench Task - Doc VQA92.5Task Score (%)100
MEGA-Bench Task - Geometry Reasoning Circled Letter96.4Task Score (%)100
MEGA-Bench Task - Graph Max Flow66.7Task Score (%)100
MEGA-Bench Task - Guess Image Generation Prompt85.8Task Score (%)100
MEGA-Bench Task - Hotel Booking Confirmation Parsing76.4Task Score (%)100

Interactive version: theaggregate.ai/model?slug=claude-3-5-sonnet-20241022 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.