AbstentionBench - answer unknown - KUQ/Future unknowns - Precision: leaderboard

Metric: Abstention Precision (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1DeepSeek R1 Distill Llama 70B97.25
2Llama-3.1-Tulu-3-8B94.47
3O194.35
4Llama 3.1 8B93.33
5Llama 3.3 70B Instruct92.31
6Llama-3.1-Tulu-3-8B-SFT92.31
7Llama-3.1-Tulu-3-8B-DPO91.95
8Llama-3.1-Tulu-3-70B91.26
9Llama 3.1 70B90.81
10GPT-4o90.63
11Llama-3.1-Tulu-3-70B-DPO89.26
12Gemini 1.5 Pro89.17
13Qwen 2.5 32B Instruct88.93
14Llama 3.1 70B Instruct88.65
15Mistral 7B Instruct (v0.3)86.43

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-answer-unknown-kuq-future-unknowns-precision · How It Works · Data refreshed daily, snapshot 2026-09-19.