Claude 3.7 Sonnet (High) — benchmark results

Claude 3.7 Sonnet evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2025-02-24. Access: API.

Unified ELO 1752 ± 22, rank #195 of 1776 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HAL GAIA Level 357.69Accuracy (%)87.5
HAL ScienceAgentBench30.39Accuracy (%)86.7
HAL Online Mind2Web39.33Accuracy (%)77.3
HAL SWE-bench Verified Mini54Score (%)76.5
HAL GAIA64.24Accuracy (%)71.9
HAL GAIA Level 263.95Accuracy (%)68.8
HAL TAU-bench Airline52Accuracy (%)67.9
HAL CORE-Bench Hard37.78Accuracy (%)61.5
HAL SciCode4.62Accuracy (%)53.3
HAL AssistantBench13.08Accuracy (%)50
HAL GAIA Level 167.92Accuracy (%)50
HAL USACO26.71Accuracy (%)0

Interactive version: theaggregate.ai/model?slug=claude-3-7-sonnet-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.