AbstentionBench - subjective - KUQ/Controversial - F1: leaderboard

Metric: Abstention F1 (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1Gemini 1.5 Pro80.63
2Llama-3.1-Tulu-3-70B-DPO79.93
3Llama-3.1-Tulu-3-70B79.87
4GPT-4o79.26
5Llama 3.3 70B Instruct78.56
6Llama-3.1-Tulu-3-8B-DPO76.31
7Llama 3.1 8B Instruct75.21
8O175
9Llama-3.1-Tulu-3-8B74.46
10Llama 3.1 405B Instruct74.35
11Llama 3.1 70B Instruct70.99
12Qwen 2.5 32B Instruct69.61
13Mistral 7B Instruct (v0.3)68.65
14Llama-3.1-Tulu-3-8B-SFT67.44
15Llama 3.1 8B61.04

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-subjective-kuq-controversial-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.