AutomationBench-AA - Operations - Raw Objective Completion: leaderboard

Metric: Raw Objective Completion (%). Source: artificialanalysis.ai. 167 models tracked.

Top models

#ModelScore
1GPT-6 (Max)97.01
2GPT-6 (xHigh)96.57
3GPT-5.6 Sol (Max)95.38
4GPT-6 (High)95.18
5GPT-6 (Medium)94.99
6GPT-5.6 Sol (xHigh)94.87
7Qwen 3.8 Max (0902)94.83
8Qwen3.8-Flash-Next94.65
9Claude Opus 5 (Adaptive Reasoning, Max Effort)94.37
10Kimi K3 (Max)94.24
11Grok 4.6 (High)94.24
12Qwen3.8 2.4T A95B93.81
13Gemini 3.7 Flash (High)93.68
14GLM-5.3 (Max)93.64
15Grok 4.6 (Medium)93.01

Interactive version: theaggregate.ai/benchmark?slug=automationbench-aa-operations-raw-objective-completion · How It Works · Data refreshed daily, snapshot 2026-09-19.