SGI-Bench Dry Experiment — leaderboard

Metric: Dry Experiment Score. Source: github.com. 19 models tracked.

Top models

#ModelScore
1Gemini 3 Pro36.64
2Claude Sonnet 4.535.79
3O4 Mini35.79
4Claude Opus 4.134.69
5GPT-4.134.32
6Grok 433.71
7Qwen 3 Max33.21
8O331.73
9GPT-5.131
10GPT-529.89
11Intern-S128.79
12Qwen 3 VL 235B A22B28.41
13GPT-5.2 Pro28.04
14GPT-4o26.94
15Gemini 2.5 Pro22.51

Interactive version: theaggregate.ai/benchmark?slug=sgi-bench-dry-experiment · How the rankings work · Data refreshed daily, snapshot 2026-07-22.