AA Omniscience - Software Engineering (SWE) - R: leaderboard

Metric: Accuracy (%). Source: artificialanalysis.ai. 294 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (Thinking)64
2Kimi K3 (Max)64
3DeepSeek V4 Pro (0813) (Reasoning, Max Effort)64
4Claude Opus 4.5 (Non-reasoning)60
5Kimi K3 (Low)60
6Claude Sonnet 4.5 (Thinking)56
7Gemini 3 Pro (Preview) (High)50
8Kimi K2.7 Code44
9Gemini 2.5 Pro42
10O342
11GPT-5.1 (High)42
12Inkling (xHigh)42
13Grok 440
14Kimi K2.5 (Thinking)40
15MiMo-V2.5-Pro (Non-reasoning)40

Interactive version: theaggregate.ai/benchmark?slug=aa-omniscience-software-engineering-swe-r · How It Works · Data refreshed daily, snapshot 2026-09-05.