Claude 3.7 Sonnet (Thinking): benchmark results

Claude 3.7 Sonnet evaluated with thinking enabled. Provider: Anthropic. Released 2025-02-24. Access: API.

Unified ELO 1585 ± 1, rank #497 of 1761 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CritPt90Accuracy (self-reported)97.7
KORGym - Puzzle0.93Score94.4
LLM2014 Logic 2025-0373.76Median Score90
BenchTable71Total Score (%)87.8
Gapminder AI Worldview87.9Correct Rate (%)85.3
SEAL - Agentic Tool Use (Enterprise)65.27Score84.8
AidanBench2170Novel Answers83.6
LLM2014 Logic 2025-0467.34Median Score82.1
GosuEvals71Score (%)81.5
REAL Evals24Task Completion (%)80.4
AA Omniscience-0.73Score80.3
Bullshit Benchmark52.7BS Detection Rate (%)79.4

Interactive version: theaggregate.ai/model?slug=claude-3-7-sonnet-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.