InteractBench - Overall - pass@5: leaderboard

Metric: pass@5 (%; n=10 samples per task). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)75.2
2GPT-5.2 (Thinking)70.5
3DeepSeek V3.2 (Thinking)51.3
4Gemini 2.5 Pro48
5GPT-OSS-120B41.6
6Claude Opus 4.5 (Thinking)31.2
7Gemini 2.5 Flash30.5
8GPT-OSS-20B28.2
9DeepSeek V3.2 (Non-reasoning)26.2
10Qwen 3 30B A3B 2507 (Thinking)22.8
11Qwen 3 32B (Thinking)18.1
12GPT-4.113.8
13Qwen 3 14B (Reasoning)12.1
14DeepSeek R1 Distill Llama 70B9.7
15Qwen 3 32B (Non-reasoning)4

Interactive version: theaggregate.ai/benchmark?slug=interactbench-overall-pass-5 · How It Works · Data refreshed daily, snapshot 2026-09-19.