AutomationBench-AA - Strict: leaderboard

Metric: Strict Task Success (%). Source: artificialanalysis.ai. 167 models tracked.

Top models

#ModelScore
1GPT-6 (Max)41.55
2GPT-6 (xHigh)39.42
3GPT-6 (High)37.44
4Grok 4.6 (xHigh)34.55
5GPT-6 (Medium)33.64
6Grok 4.6 (High)32.72
7Gemini 3.8 Flash (High)32.12
8Gemini 3.8 Flash (Medium)31.05
9GPT-5.6 Sol (Max)30.29
10Gemini 3.7 Flash (High)29.98
11Muse Spark 1.3 (Max)29.83
12GLM-5.3 (Max)29.38
13Grok 4.6 (Medium)29.38
14Claude Opus 5 (Adaptive Reasoning, Max Effort)28.31
15GPT-6 (Low)27.7

Interactive version: theaggregate.ai/benchmark?slug=automationbench-aa-strict · How It Works · Data refreshed daily, snapshot 2026-09-19.