AutomationBench-AA: leaderboard

Metric: Guardrail-Adjusted Objective Completion (%). Source: artificialanalysis.ai. 167 models tracked.

Top models

#ModelScore
1GPT-6 (Max)68.49
2GPT-6 (xHigh)67.18
3Grok 4.6 (xHigh)67
4Grok 4.6 (High)66.68
5GPT-6 (High)66.61
6GPT-6 (Medium)64.59
7Grok 4.6 (Medium)63.15
8GLM-5.3 (Max)62.2
9Gemini 3.7 Flash (High)62.03
10Gemini 3.8 Flash (Medium)60.89
11GLM-5.3 Flash60.37
12GPT-5.6 Sol (Max)60.08
13Gemini 3.8 Flash (High)59.93
14GPT-5.6 Terra (Max)59.65
15GPT-6 (Low)59.1

Interactive version: theaggregate.ai/benchmark?slug=automationbench-aa · How It Works · Data refreshed daily, snapshot 2026-09-19.