Claude Sonnet 4.5 (Thinking) — benchmark results

Claude Sonnet 4.5 evaluated with extended thinking enabled for harder reasoning and agentic tasks. Provider: Anthropic. Released 2025-09-29. Access: API.

Unified ELO 1688 ± 8, rank #297 of 1776 rated models, from 435 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval Croatian Common Sense Reasoning82.86Common Sense Reasoning Average Score (%)100
EuroEval Czech Common Sense Reasoning85.14Common Sense Reasoning Average Score (%)100
EuroEval Danish NLU - Angry Tweets64.26Sentiment classification Score (%)100
EuroEval Hungarian Knowledge85.53Knowledge Average Score (%)100
EuroEval Icelandic NLU - MIM-GOLD NER86.91Named entity recognition Score (%)100
EuroEval Latvian Knowledge87.47Knowledge Average Score (%)100
EuroEval Lithuanian Common Sense Reasoning85.65Common Sense Reasoning Average Score (%)100
EuroEval Polish Common Sense Reasoning80.96Common Sense Reasoning Average Score (%)100
EuroEval Romanian Common Sense Reasoning80.3Common Sense Reasoning Average Score (%)100
EuroEval Serbian Common Sense Reasoning78.7Common Sense Reasoning Average Score (%)100
EuroEval Serbian Knowledge91.4Knowledge Average Score (%)100
EuroEval Slovak Common Sense Reasoning77.5Common Sense Reasoning Average Score (%)100

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.