AbstentionBench - subjective - CoCoNot/Subjective - F1: leaderboard

Metric: Abstention F1 (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1Llama-3.1-Tulu-3-70B-DPO97.26
2Llama-3.1-Tulu-3-70B95.83
3Llama-3.1-Tulu-3-8B-DPO92.86
4Gemini 1.5 Pro89.71
5Llama-3.1-Tulu-3-8B88.89
6GPT-4o88.06
7O188.06
8Llama 3.1 8B Instruct86.36
9Llama 3.1 405B Instruct84.62
10Qwen 2.5 32B Instruct82.81
11Llama-3.1-Tulu-3-8B-SFT82.81
12Llama 3.1 70B Instruct81.89
13Mistral 7B Instruct (v0.3)79.03
14Llama 3.1 70B76.03
15Llama 3.3 70B Instruct73.95

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-subjective-coconot-subjective-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.