ArchSIBench: leaderboard

Metric: Avg. (self-reported). Source: benchmarklist.com. 29 models tracked.

Top models

#ModelScore
1Gemini 3 Pro77.9
2Gemini 3 Flash77.6
3Gemini 3.1 Pro (Preview)77.2
4Qwen 3.5 Plus63.2
5GPT-5 Mini62.8
6Gemma 4 31B (IT)62.5
7Qwen 3.5 397B A17B56.7
8Qwen 3.5 27B55.9
9GPT-5.453.8
10Qwen 3.5 122B A10B53.6
11GPT-5.253.5
12Claude Opus 4.653.3
13Gemma 4 26B A4B (IT)52
14Qwen 3.5 35B A3B52
15GPT-5 Nano51.9

Interactive version: theaggregate.ai/benchmark?slug=archsibench · How It Works · Data refreshed daily, snapshot 2026-09-05.