IHBench - Task Fulfillment: leaderboard

Metric: Win rate against GPT-4o Audio (%; share of 428 interruption points where a GPT-5.4-mini judge (high reasoning) prefers the model's next turn for advancing the workflow, audio input, mean of three epochs). Source: arxiv.org. Saturation forecast: Around December 2026. 27 models tracked.

Top models

#ModelScore
1GPT Audio64.4
2Gemini 2.5 Flash (Thinking)58.6
3Gemini 3.1 Pro (Preview)58.2
4Gemini 2.5 Pro52.6
5Gemma 4 12B (Reasoning)51.1
6Gemma 4 12B (Non-reasoning)50.5
7Gemini 2.5 Flash (Non-reasoning)48.8
8GPT Audio Mini48.4
9Voxtral-Small-24B-250730.8
10Qwen3 Omni 30B A3B Instruct30.4
11Qwen2.5-Omni-7B18.1
12Phi-4 Multimodal Instruct10.4
13Qwen2-Audio-7B-Instruct4.4

Interactive version: theaggregate.ai/benchmark?slug=ihbench-task-fulfillment · How It Works · Data refreshed daily, snapshot 2026-09-26.