AA Omniscience - Software Engineering (SWE) - TypeScript: leaderboard

Metric: Accuracy (%). Source: artificialanalysis.ai. 294 models tracked.

Top models

#ModelScore
1Kimi K3 (Max)77.78
2Kimi K3 (Low)75.28
3Claude Opus 4.5 (Thinking)71.11
4DeepSeek V4 Pro (0813) (Reasoning, Max Effort)71.11
5Kimi K2.7 Code66.67
6Gemini 3 Pro (Preview) (High)64.44
7Claude Opus 4.5 (Non-reasoning)64.44
8Kimi K2.5 (Thinking)60
9Inkling (xHigh)60
10DeepSeek V4 Pro (Reasoning, Max Effort)57.78
11DeepSeek V4 Pro (Reasoning, High Effort)55.56
12Kimi K2.654.44
13DeepSeek V4 Flash (Reasoning, Max Effort)54.44
14Hy353.33
15Claude Sonnet 4.5 (Thinking)52.22

Interactive version: theaggregate.ai/benchmark?slug=aa-omniscience-software-engineering-swe-typescript · How It Works · Data refreshed daily, snapshot 2026-09-05.