AA Omniscience - Software Engineering (SWE) - JavaScript: leaderboard

Metric: Accuracy (%). Source: artificialanalysis.ai. 294 models tracked.

Top models

#ModelScore
1Kimi K3 (Max)78.18
2Gemini 3 Pro (Preview) (High)75.45
3Claude Opus 4.5 (Thinking)73.64
4Kimi K3 (Low)70.91
5DeepSeek V4 Pro (0813) (Reasoning, Max Effort)66.36
6Claude Opus 4.5 (Non-reasoning)60
7Kimi K2.658.18
8Claude Sonnet 4.5 (Thinking)58.18
9GPT-5 (High)58.18
10DeepSeek V4 Pro (Reasoning, Max Effort)57.27
11Kimi K2.7 Code56.36
12GPT-5.1 (High)55.45
13GPT-5 Codex (High)55.45
14GPT-5 (Medium)54.55
15Inkling (xHigh)54.55

Interactive version: theaggregate.ai/benchmark?slug=aa-omniscience-software-engineering-swe-javascript · How It Works · Data refreshed daily, snapshot 2026-09-05.