SGI-Bench Wet Experiment — leaderboard

Metric: Wet Experiment Score. Source: github.com. 19 models tracked.

Top models

#ModelScore
1GPT-4.136.63
2Qwen 3 Max33.62
3Gemini 3 Pro32.45
4GPT-4o31.31
5Qwen 3 VL 235B A22B30.3
6Claude Sonnet 4.530.15
7O330.04
8Intern-S129.02
9Grok 429.01
10O4 Mini28.86
11Claude Opus 4.125.38
12GPT-5.122.77
13Gemini 2.5 Pro22.05
14Llama 4 Scout21.66
15Gemini 2.5 Flash18.55

Interactive version: theaggregate.ai/benchmark?slug=sgi-bench-wet-experiment · How the rankings work · Data refreshed daily, snapshot 2026-07-22.