AbstentionBench - answer unknown - CoCoNot/Unsupported - F1: leaderboard

Metric: Abstention F1 (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1Llama-3.1-Tulu-3-70B-DPO97.46
2Llama-3.1-Tulu-3-70B96.23
3Llama-3.1-Tulu-3-8B-SFT95.87
4Gemini 1.5 Pro95.76
5Qwen 2.5 32B Instruct95.69
6Llama-3.1-Tulu-3-8B-DPO95.69
7GPT-4o95.24
8Llama-3.1-Tulu-3-8B94.83
9Llama 3.1 405B Instruct92.51
10O192.38
11Llama 3.1 8B Instruct92.04
12Llama 3.3 70B Instruct90.75
13Llama 3.1 70B Instruct90.58
14Mistral 7B Instruct (v0.3)89.91
15DeepSeek R1 Distill Llama 70B78.17

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-answer-unknown-coconot-unsupported-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.