Claude 3 Sonnet — benchmark results

Provider: Anthropic. Released 2024-03-04. Access: API.

Unified ELO 1039 ± 24, rank #1770 of 1776 rated models, from 406 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CRMArena - PVI41.5PVI Score (%)100
InfiBench58.2Score (%)91.4
OpenVLM MMMU - Computer Science70Accuracy (%)89.4
OpenVLM MMT-Bench - Interactive Segmentation57.1Score (%)87.6
OpenVLM MMMU - Finance66.7Accuracy (%)84.3
OpenVLM MMMU - Music40Accuracy (%)84.1
CZ-EVAL - Critical Thinking68.89Accuracy (%)81.8
CZ-EVAL - Klokan (Math)44.28Accuracy (%)81.8
OpenVLM MMT-Bench - Counting By Reasoning85Score (%)81.3
OpenVLM LLaVA-Bench - Detail79.4Score78.8
OpenVLM MMMU - Economics63.3Accuracy (%)77.6
SynthPAI70.9Average accuracy in %76.5

Interactive version: theaggregate.ai/model?slug=claude-3-sonnet · How the rankings work · Data refreshed daily, snapshot 2026-07-22.