AbstentionBench - underspecified intent - SituatedQA/Geo - F1: leaderboard

Metric: Abstention F1 (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1GPT-4o70.99
2O166.44
3Llama 3.3 70B Instruct64.46
4Llama-3.1-Tulu-3-70B-DPO64.04
5Llama-3.1-Tulu-3-70B63.28
6Llama 3.1 8B Instruct63.08
7Llama-3.1-Tulu-3-8B62.66
8Llama-3.1-Tulu-3-8B-DPO60.53
9Mistral 7B Instruct (v0.3)59.85
10Qwen 2.5 32B Instruct58.68
11Llama-3.1-Tulu-3-8B-SFT56.72
12Llama 3.1 405B Instruct54.23
13Llama 3.1 70B Instruct54.18
14DeepSeek R1 Distill Llama 70B53.48
15Gemini 1.5 Pro52.59

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-underspecified-intent-situatedqa-geo-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.