Claude Sonnet 5 (xHigh): benchmark results

Claude Sonnet 5 evaluated at the xhigh reasoning-effort setting. Provider: Anthropic. Released 2026-06-30. Access: API.

Unified ELO 1696 ± 1, rank #116 of 1761 rated models, from 35 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LiveBench Logic With Navigation86Score94.3
LiveBench Code Generation83.1Score91.5
OTIS Mock AIME 2024-2594.72Accuracy (%)86.8
Chess Puzzles (Epoch AI)35Accuracy (%)84.2
LiveBench Spatial100Score84
DuelLab Overall54.3DuelLab Score83.8
LiveBench TypeScript50Score83
LiveBench Python60Score77.4
LiveBench Integrals With Game88Score72.6
LiveBench JavaScript68.18Score70.8
LLM2014 Logic 2026-0743.14Median Score65.1
LiveBench Theory of Mind80.77Score63.2

Interactive version: theaggregate.ai/model?slug=claude-sonnet-5-xhigh · How It Works · Data refreshed daily, snapshot 2026-09-05.