InteractBench - Hard - pass@1: leaderboard

Metric: pass@1 (%; n=10 samples per task). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)36.7
2GPT-5.2 (Thinking)34
3DeepSeek V3.2 (Thinking)10.4
4Gemini 2.5 Pro9.2
5GPT-OSS-120B7.8
6DeepSeek V3.2 (Non-reasoning)2.4
7GPT-OSS-20B2.1
8Claude Opus 4.5 (Thinking)2.1
9Qwen 3 30B A3B 2507 (Thinking)1.2
10Gemini 2.5 Flash0.9
11Qwen 3 32B (Thinking)0.9
12GPT-4.10.3
13DeepSeek R1 Distill Llama 70B0
14Qwen 3 14B (Non-reasoning)0
15Qwen 3 32B (Non-reasoning)0

Interactive version: theaggregate.ai/benchmark?slug=interactbench-hard-pass-1 · How It Works · Data refreshed daily, snapshot 2026-09-19.