AbstentionBench - false premise - KUQ/False assumptions - Precision: leaderboard

Metric: Abstention Precision (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1DeepSeek R1 Distill Llama 70B96.18
2O194.81
3Llama-3.1-Tulu-3-8B-SFT93.23
4Gemini 1.5 Pro92.31
5Llama-3.1-Tulu-3-8B-DPO91.93
6Llama-3.1-Tulu-3-8B91.52
7GPT-4o91.22
8Llama 3.1 8B90.98
9Llama 3.3 70B Instruct90.5
10Llama-3.1-Tulu-3-70B90.26
11Llama-3.1-Tulu-3-70B-DPO90.21
12Llama 3.1 70B89.13
13Mistral 7B Instruct (v0.3)87.82
14Qwen 2.5 32B Instruct86.91
15Llama 3.1 70B Instruct86.44

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-false-premise-kuq-false-assumptions-precision · How It Works · Data refreshed daily, snapshot 2026-09-19.