AutomationBench-AA - HR - Raw Objective Completion: leaderboard

Metric: Raw Objective Completion (%). Source: artificialanalysis.ai. 167 models tracked.

Top models

#ModelScore
1GPT-6 (High)77.08
2Grok 4.6 (High)76.94
3GPT-6 (Max)76.89
4GPT-6 (xHigh)76.37
5Qwen 3.8 Max (0902)75.76
6Claude Opus 5 (Adaptive Reasoning, Max Effort)75.43
7Grok 4.6 (xHigh)75.28
8GPT-5.6 Sol (Max)75.09
9GPT-6 (Medium)75
10Grok 4.6 (Medium)74.95
11Qwen3.8-Flash-Next74.81
12GLM-5.3 Flash74.43
13Gemini 3.7 Flash (High)74.29
14Muse Spark 1.3 (Max)74.29
15Qwen3.8 2.4T A95B74.24

Interactive version: theaggregate.ai/benchmark?slug=automationbench-aa-hr-raw-objective-completion · How It Works · Data refreshed daily, snapshot 2026-09-19.