Claude 3.7 Sonnet (Thinking) — benchmark results

Claude 3.7 Sonnet evaluated with thinking enabled. Provider: Anthropic. Released 2025-02-24. Access: API.

Unified ELO 1652 ± 16, rank #362 of 1776 rated models, from 101 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
KORGym - Puzzle0.93Score94.4
LLM2014 Logic 2025-0373.76Median Score90
BenchTable71Total Score (%)87.8
AA Omniscience0.32Score86.8
AA MMLU-Pro83.69Accuracy (%)86
Gapminder AI Worldview87.9Correct Rate (%)85.3
SEAL - Agentic Tool Use (Enterprise)65.27Score84.8
AA Omniscience - Software Engineering (SWE) - Julia36Accuracy (%)84.6
AidanBench2170Novel Answers83.6
AA Omniscience - Software Engineering (SWE) - Dart38Accuracy (%)83.3
AA Omniscience - Law26.1Accuracy (%)82.4
LLM2014 Logic 2025-0467.34Median Score82.1

Interactive version: theaggregate.ai/model?slug=claude-3-7-sonnet-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.