IHBench - Recovery Quality: leaderboard

Metric: Recovery pass rate (%; share of 428 interruption points meeting every type-specific recovery criterion, GPT-5.4-mini judge (high reasoning), audio input, mean of three epochs). Source: arxiv.org. Saturation forecast: Around January 2027. 27 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash (Thinking)70.4
2Gemini 2.5 Pro69.5
3Gemini 2.5 Flash (Non-reasoning)67.9
4Qwen3 Omni 30B A3B Instruct67.6
5GPT-4o Audio65.4
6Gemini 3.1 Pro (Preview)64.9
7GPT Audio64.9
8Voxtral-Small-24B-250759.3
9GPT Audio Mini57.9
10Gemma 4 12B (Reasoning)55
11Gemma 4 12B (Non-reasoning)54
12Qwen2.5-Omni-7B53
13Phi-4 Multimodal Instruct46.5
14Qwen2-Audio-7B-Instruct39.5

Interactive version: theaggregate.ai/benchmark?slug=ihbench-recovery-quality · How It Works · Data refreshed daily, snapshot 2026-09-26.