AA Omniscience - Software Engineering (SWE) — leaderboard

Metric: Accuracy (%). Source: artificialanalysis.ai. 449 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)84.5
2GPT-5.5 (xHigh)84.4
3GPT-5.5 (High)83.9
4GPT-5.6 Sol (xHigh)83.8
5GPT-5.3 Codex (xHigh)83.8
6GPT-5.5 (Medium)83.4
7GPT-5.6 Sol (High)82.9
8GPT-5.4 (xHigh)82.5
9GPT-5.5 (Low)82.2
10GPT-5.6 Sol (Low)81.7
11GPT-5.6 Sol (Medium)81.1
12GPT-5.4 (Low)79.4
13Claude Opus 4.6 (Adaptive Reasoning, Max Effort)73.5
14Claude Opus 4.8 (Adaptive Reasoning, Max Effort)73.3
15GPT-5.6 Terra (Max)72.1

Interactive version: theaggregate.ai/benchmark?slug=aa-omniscience-software-engineering-swe · How the rankings work · Data refreshed daily, snapshot 2026-07-22.