AudioBench: leaderboard
Audio-language benchmark covering speech, sound, music, ASR, QA, translation, and audio reasoning tasks across many task-level metrics.
Metric: Mean Score (%). Source: github.com. Status: saturated. 13 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4o Audio | 37.02 |
| 2 | Qwen2-Audio-7B-Instruct | 32.27 |
| 3 | Phi-4 Multimodal Instruct | 25.2 |
| 4 | Gemini 1.5 Flash | 25.18 |
| 5 | SALMONN-7B | 20.96 |
Interactive version: theaggregate.ai/benchmark?slug=audiobench · How It Works · Data refreshed daily, snapshot 2026-09-05.