AbstentionBench - subjective - MoralChoice - F1: leaderboard

Metric: Abstention F1 (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1Llama 3.1 70B56.73
2Llama 3.1 8B45.75
3Llama-3.1-Tulu-3-70B45.65
4Llama-3.1-Tulu-3-70B-DPO45.12
5O144.95
6Llama 3.1 405B Instruct43.71
7Llama-3.1-Tulu-3-8B-DPO43.3
8Mistral 7B Instruct (v0.3)41.75
9Llama-3.1-Tulu-3-8B41.48
10GPT-4o41.35
11Qwen 2.5 32B Instruct41.3
12Llama-3.1-Tulu-3-8B-SFT40.75
13Llama 3.1 8B Instruct40.19
14Llama 3.3 70B Instruct38.92
15Llama 3.1 70B Instruct38.92

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-subjective-moralchoice-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.