InteractBench - Hard - pass@5: leaderboard

Metric: pass@5 (%; n=10 samples per task). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)59.7
2GPT-5.2 (Thinking)49.2
3DeepSeek V3.2 (Thinking)23.9
4Gemini 2.5 Pro22.4
5GPT-OSS-120B17.9
6GPT-OSS-20B7.5
7Qwen 3 30B A3B 2507 (Thinking)6
8Claude Opus 4.5 (Thinking)6
9DeepSeek V3.2 (Non-reasoning)6
10Gemini 2.5 Flash4.5
11Qwen 3 32B (Thinking)4.5
12GPT-4.11.5
13DeepSeek R1 Distill Llama 70B0
14Qwen 3 14B (Non-reasoning)0
15Qwen 3 32B (Non-reasoning)0

Interactive version: theaggregate.ai/benchmark?slug=interactbench-hard-pass-5 · How It Works · Data refreshed daily, snapshot 2026-09-19.