RAIL - Acquired Knowledge: leaderboard

Metric: LLM-as-judge score (%) on acquired-knowledge tasks over speech, sound and music; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 26 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)79.19
2Gemini 3 Flash76.63
3Gemini 2.5 Flash72.68
4GPT-4o Audio72.31
5MERaLiON-2-10B62.62
6Qwen2-Audio-7B-Instruct57.99
7GPT Audio51.53
8Gemma 3n E4B (IT)48.42
9SALMONN-13B32.35

Interactive version: theaggregate.ai/benchmark?slug=rail-acquired-knowledge · How It Works · Data refreshed daily, snapshot 2026-09-29.