AIR-Bench — leaderboard

Heterogeneous information retrieval benchmark evaluating retrieval models across diverse tasks in multiple languages. Accepted at ACL 2025. 60+ models.

Metric: Average Score. Source: huggingface.co. 60 models tracked.

Top models

#ModelScore
1inf-retriever-v168.49
2inf-retriever-v1-1.5b66.41
3inf-retriever-v164.37
4inf-retriever-v1-1.5b62.61
5BM2558.57
6BM2556.28
7inf-retriever-v154.47
8bge-multilingual-gemma254.46
9BM2553.78
10inf-retriever-v152.42

Interactive version: theaggregate.ai/benchmark?slug=air-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.