InteractBench - Easy - pass@5: leaderboard

Metric: pass@5 (%; n=10 samples per task). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)96.1
2GPT-5.2 (Thinking)92.1
3DeepSeek V3.2 (Thinking)81.6
4Gemini 2.5 Pro76.3
5GPT-OSS-120B75
6Claude Opus 4.5 (Thinking)59.2
7GPT-OSS-20B57.9
8Gemini 2.5 Flash56.6
9DeepSeek V3.2 (Non-reasoning)50
10Qwen 3 32B (Thinking)42.1
11Qwen 3 30B A3B 2507 (Thinking)40.8
12GPT-4.134.2
13Qwen 3 14B (Reasoning)26.3
14DeepSeek R1 Distill Llama 70B22.4
15Qwen 3 14B (Non-reasoning)9.2

Interactive version: theaggregate.ai/benchmark?slug=interactbench-easy-pass-5 · How It Works · Data refreshed daily, snapshot 2026-09-19.