AA Omniscience - Software Engineering (SWE) - Python — leaderboard

Metric: Accuracy (%). Source: artificialanalysis.ai. 449 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)90.5
2GPT-5.4 (xHigh)90
3GPT-5.5 (Medium)89
4GPT-5.6 Sol (Max)88.5
5GPT-5.5 (Low)88
6GPT-5.3 Codex (xHigh)87.5
7GPT-5.5 (High)87
8GPT-5.6 Sol (High)85.5
9GPT-5.6 Sol (xHigh)85
10GPT-5.4 (Low)85
11GPT-5.6 Sol (Medium)85
12GPT-5.6 Sol (Low)85
13GPT-5.6 Terra (Max)81
14GPT-5.6 Terra (xHigh)78.5
15GPT-5.6 Terra (High)78

Interactive version: theaggregate.ai/benchmark?slug=aa-omniscience-software-engineering-swe-python · How the rankings work · Data refreshed daily, snapshot 2026-07-22.