IHBench - Recovery Quality - Normal: leaderboard

Metric: Recovery pass rate (%; 81 normal cut-ins, every type-specific criterion met, GPT-5.4-mini judge (high reasoning), audio input, mean of three epochs). Source: arxiv.org. Saturation forecast: Around December 2026. 27 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)82
2GPT-4o Audio82
3GPT Audio82
4Qwen3 Omni 30B A3B Instruct80
5GPT Audio Mini77
6Gemini 2.5 Flash (Non-reasoning)76
7Gemini 2.5 Pro75
8Gemini 2.5 Flash (Thinking)75
9Voxtral-Small-24B-250774
10Gemma 4 12B (Reasoning)66
11Qwen2.5-Omni-7B65
12Gemma 4 12B (Non-reasoning)63
13Phi-4 Multimodal Instruct52
14Qwen2-Audio-7B-Instruct51

Interactive version: theaggregate.ai/benchmark?slug=ihbench-recovery-quality-normal · How It Works · Data refreshed daily, snapshot 2026-09-26.