AbstentionBench - underspecified intent - SituatedQA/Geo - Recall: leaderboard

Metric: Abstention Recall (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1Llama-3.1-Tulu-3-70B-DPO88.37
2Llama-3.1-Tulu-3-70B86.82
3Llama-3.1-Tulu-3-8B-DPO79.07
4Llama-3.1-Tulu-3-8B76.74
5Qwen 2.5 32B Instruct75.97
6O175.97
7Llama-3.1-Tulu-3-8B-SFT73.64
8GPT-4o72.09
9Llama 3.1 8B Instruct68.22
10Mistral 7B Instruct (v0.3)61.24
11Llama 3.3 70B Instruct60.47
12Llama 3.1 405B Instruct59.69
13Gemini 1.5 Pro55.04
14Llama 3.1 70B Instruct52.71
15Llama 3.1 70B43.41

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-underspecified-intent-situatedqa-geo-recall · How It Works · Data refreshed daily, snapshot 2026-09-19.