Claude 3 Sonnet: benchmark results

Provider: Anthropic. Released 2024-03-04. Access: API.

Unified ELO 1429 ± 1, rank #1031 of 1392 rated models, from 403 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CRMArena - PVI41.5PVI Score (%)100
OpenVLM MMMU - Computer Science70Accuracy (%)89.4
OpenVLM MMT-Bench - Interactive Segmentation57.1Score (%)87.6
OpenVLM MMMU - Finance66.7Accuracy (%)84.3
OpenVLM MMMU - Music40Accuracy (%)84.1
CZ-EVAL - Critical Thinking68.89Accuracy (%)81.8
CZ-EVAL - Klokan (Math)44.28Accuracy (%)81.8
OpenVLM MMT-Bench - Counting By Reasoning85Score (%)81.3
OpenVLM LLaVA-Bench - Detail79.4Score78.8
OpenVLM MMMU - Economics63.3Accuracy (%)77.6
SynthPAI70.9Average accuracy in %76.5
OpenVLM MMMU - Clinical Medicine63.3Accuracy (%)76.1

Interactive version: theaggregate.ai/model?slug=claude-3-sonnet · How It Works · Data refreshed daily, snapshot 2026-09-05.