Claude 3.7 Sonnet (High) — benchmark results
Claude 3.7 Sonnet evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2025-02-24. Access: API.
Unified ELO 1752 ± 22, rank #195 of 1776 rated models, from 12 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HAL GAIA Level 3 | 57.69 | Accuracy (%) | 87.5 |
| HAL ScienceAgentBench | 30.39 | Accuracy (%) | 86.7 |
| HAL Online Mind2Web | 39.33 | Accuracy (%) | 77.3 |
| HAL SWE-bench Verified Mini | 54 | Score (%) | 76.5 |
| HAL GAIA | 64.24 | Accuracy (%) | 71.9 |
| HAL GAIA Level 2 | 63.95 | Accuracy (%) | 68.8 |
| HAL TAU-bench Airline | 52 | Accuracy (%) | 67.9 |
| HAL CORE-Bench Hard | 37.78 | Accuracy (%) | 61.5 |
| HAL SciCode | 4.62 | Accuracy (%) | 53.3 |
| HAL AssistantBench | 13.08 | Accuracy (%) | 50 |
| HAL GAIA Level 1 | 67.92 | Accuracy (%) | 50 |
| HAL USACO | 26.71 | Accuracy (%) | 0 |
Interactive version: theaggregate.ai/model?slug=claude-3-7-sonnet-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.