InteractBench - Easy - pass@1: leaderboard

Metric: pass@1 (%; n=10 samples per task). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)80.3
2GPT-5.2 (Thinking)74.2
3DeepSeek V3.2 (Thinking)64.5
4Gemini 2.5 Pro58.7
5GPT-OSS-120B52.1
6Gemini 2.5 Flash33.2
7Claude Opus 4.5 (Thinking)31.8
8GPT-OSS-20B31.3
9DeepSeek V3.2 (Non-reasoning)30.8
10Qwen 3 32B (Thinking)23.7
11Qwen 3 30B A3B 2507 (Thinking)19
12GPT-4.116.3
13Qwen 3 14B (Reasoning)14.7
14DeepSeek R1 Distill Llama 70B10.5
15Qwen 3 32B (Non-reasoning)3.2

Interactive version: theaggregate.ai/benchmark?slug=interactbench-easy-pass-1 · How It Works · Data refreshed daily, snapshot 2026-09-19.