Active-SWE - Test Validity: leaderboard

Metric: Test Validity (%). Source: hbinli.github.io. 18 models tracked.

Top models

#ModelScore
1GPT-5.587.5
2Claude Opus 4.881
3Qwen 3.7 Max81
4GLM-5.279
5Claude Sonnet 4.678.3
6Gemini 3.1 Pro (Preview)77.8
7Hy377.3
8Kimi K2.667.3
9Ring-2.6-1T65.5
10Kimi K2.7 Code65
11DeepSeek V4 Pro64.3
12Qwen 3.5 397B A17B56.8
13GPT-5.452.3
14Ling-3.0-flash49
15Qwen 3.5 122B A10B46.8

Interactive version: theaggregate.ai/benchmark?slug=active-swe-test-validity · How It Works · Data refreshed daily, snapshot 2026-09-19.