Claude 3.7 Sonnet (20250219) — benchmark results
February 19, 2025 Claude 3.7 Sonnet snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2025-02-19. Access: API.
Unified ELO 1655 ± 9, rank #357 of 1776 rated models, from 207 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ChemBench | 65.83 | Overall Score (%) | 100 |
| CyberSecEval2 Vulnerability Exploit | 56.82 | Accuracy (%) | 100 |
| GDM InterCode CTF | 87.34 | Accuracy (%) | 100 |
| Galileo Tool Tasks - BFCL v3 Multi-Turn Base Multi-Function | 92 | Accuracy (%) | 100 |
| Galileo Tool Tasks - BFCL v3 Multi-Turn Composite | 96 | Accuracy (%) | 100 |
| Galileo Tool Tasks - BFCL v3 Multi-Turn Long Context | 94 | Accuracy (%) | 100 |
| Galileo Tool Tasks - BFCL v3 Multi-Turn Missing Parameter | 97 | Accuracy (%) | 100 |
| Galileo Tool Tasks - Multi Turn | 95 | Accuracy (%) | 100 |
| Galileo Tool Tasks - Single Turn | 96 | Accuracy (%) | 100 |
| Galileo Tool Tasks - tau Long Context | 100 | Accuracy (%) | 100 |
| Galileo Tool Tasks - xLAM Tool Missing | 96 | Accuracy (%) | 100 |
| HELM MedHELM - SHC-BMT | 90 | EM | 100 |
Interactive version: theaggregate.ai/model?slug=claude-3-7-sonnet-20250219 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.