InteractBench - Medium - pass@5: leaderboard

Metric: pass@5 (%; n=10 samples per task). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)71.6
2GPT-5.2 (Thinking)69
3DeepSeek V3.2 (Thinking)48.4
4Gemini 2.5 Pro45.2
5GPT-OSS-120B35.5
6Gemini 2.5 Flash29
7Claude Opus 4.5 (Thinking)28.4
8DeepSeek V3.2 (Non-reasoning)23.2
9GPT-OSS-20B22.6
10Qwen 3 30B A3B 2507 (Thinking)21.3
11Qwen 3 32B (Thinking)12.3
12Qwen 3 14B (Reasoning)10.3
13GPT-4.19
14DeepSeek R1 Distill Llama 70B7.7
15Qwen 3 32B (Non-reasoning)3.2

Interactive version: theaggregate.ai/benchmark?slug=interactbench-medium-pass-5 · How It Works · Data refreshed daily, snapshot 2026-09-19.