Claude Sonnet 4 (Non-reasoning) — benchmark results

Claude Sonnet 4 evaluated with reasoning disabled. Provider: Anthropic. Released 2025-05-22. Access: API.

Unified ELO 1669 ± 22, rank #327 of 1776 rated models, from 49 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI - Writing63.68Writing Score95.4
UGI - Natural Intelligence51.13NatInt Score91.2
AA MMLU-Pro83.66Accuracy (%)85.8
Confabulation Leaderboard (Lechmazur)5.45Confabulation rate % (lower is better)85.7
AA Omniscience - Software Engineering (SWE) - Julia36Accuracy (%)84.6
AA Omniscience - Software Engineering (SWE) - Dart36Accuracy (%)81.2
AA Omniscience - Software Engineering (SWE) - Rust66Accuracy (%)80.6
AA Omniscience-9.23Score80.5
AA Omniscience - Software Engineering (SWE) - Go34Accuracy (%)78.7
AA Omniscience - Software Engineering (SWE) - C58Accuracy (%)78.3
AA Omniscience - Software Engineering (SWE)38.9Accuracy (%)76.3
AA Omniscience - Software Engineering (SWE) - Python35Accuracy (%)76.3

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-non-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.