ArchSIBench — leaderboard

Metric: Avg. (self-reported). Source: benchmarklist.com. 28 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)77.6
2Gemini 3.1 Pro (Preview)77.2
3Qwen 3.5 Plus (2026-04-20)63.2
4GPT-5 Mini62.8
5Gemma 4 31B62.5
6Qwen 3.5 397B A17B56.7
7Qwen 3.5 27B55.9
8GPT-5.453.8
9Qwen 3.5 122B A10B53.6
10GPT-5.253.5
11Claude Opus 4.653.3
12Gemma 4 26B A4B52
13Qwen 3.5 35B A3B52
14GPT-5 Nano51.9
15GPT-4o49.1

Interactive version: theaggregate.ai/benchmark?slug=archsibench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.