AbstentionBench - underspecified context - UMWP - Precision: leaderboard

Metric: Abstention Precision (%). Source: github.com. 19 models tracked.

Top models

#ModelScore
1Llama-3.1-Tulu-3-8B100
2Llama-3.1-Tulu-3-8B-DPO100
3O199.85
4Llama-3.1-Tulu-3-70B99.77
5GPT-4o99.74
6Llama-3.1-Tulu-3-70B-DPO99.65
7DeepSeek R1 Distill Llama 70B99.6
8Llama 3.1 70B Instruct99.6
9Llama 3.3 70B Instruct99.47
10Llama 3.1 8B Instruct99.36
11Qwen 2.5 32B Instruct99.14
12Gemini 1.5 Pro98.68
13Llama-3.1-Tulu-3-8B-SFT98.25
14Mistral 7B Instruct (v0.3)93.07
15Llama 3.1 70B92.12

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-underspecified-context-umwp-precision · How It Works · Data refreshed daily, snapshot 2026-09-19.