IHBench - Recovery Quality - Correction: leaderboard

Metric: Recovery pass rate (%; 25 user corrections, every type-specific criterion met, GPT-5.4-mini judge (high reasoning), audio input, mean of three epochs). Source: arxiv.org. Saturation forecast: Around December 2026. 27 models tracked.

Top models

#ModelScore
1GPT-4o Audio76
2GPT Audio76
3GPT Audio Mini72
4Gemini 2.5 Pro65
5Gemini 2.5 Flash (Thinking)63
6Gemini 2.5 Flash (Non-reasoning)61
7Gemini 3.1 Pro (Preview)57
8Qwen3 Omni 30B A3B Instruct55
9Voxtral-Small-24B-250749
10Gemma 4 12B (Non-reasoning)48
11Gemma 4 12B (Reasoning)44
12Qwen2.5-Omni-7B33
13Qwen2-Audio-7B-Instruct31
14Phi-4 Multimodal Instruct28

Interactive version: theaggregate.ai/benchmark?slug=ihbench-recovery-quality-correction · How It Works · Data refreshed daily, snapshot 2026-09-26.