BABILong (NIAH, v0, 64k): leaderboard

Metric: QA1–5 Mean Accuracy (%). Source: huggingface.co. Saturation forecast: Estimated already saturated. 18 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct53
2Llama 3.1 8B Instruct49
3Yi-34B-200K48
4c4ai-command-r-v0146
5Phi-3-medium-128k-instruct45
6GPT-4 Preview (0125)43
7Phi-3 Mini 128K Instruct37
8Mixtral 8x22B Instruct (v0.1)35
9Yi-9B-200K29
10Yarn-Mistral-7B-128k10

Interactive version: theaggregate.ai/benchmark?slug=babilong-niah-v0-64k · How It Works · Data refreshed daily, snapshot 2026-10-09.