AbstentionBench - false premise - KUQ/False assumptions - F1: leaderboard

Metric: Abstention F1 (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1GPT-4o79.41
2Gemini 1.5 Pro78.09
3Llama-3.1-Tulu-3-70B76.36
4Llama-3.1-Tulu-3-70B-DPO76.09
5Llama 3.3 70B Instruct72.81
6Qwen 2.5 32B Instruct72.65
7Llama 3.1 405B Instruct71.67
8Llama 3.1 8B Instruct70.64
9Llama-3.1-Tulu-3-8B70.07
10O169.52
11Llama-3.1-Tulu-3-8B-DPO69.32
12Llama 3.1 70B Instruct69.07
13Mistral 7B Instruct (v0.3)64.93
14DeepSeek R1 Distill Llama 70B63.48
15Llama-3.1-Tulu-3-8B-SFT62.16

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-false-premise-kuq-false-assumptions-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.