AbstentionBench - underspecified context - GSM8K - F1: leaderboard

Metric: Abstention F1 (%). Source: github.com. 23 models tracked.

Top models

#ModelScore
1O1 (Low)97.73
2O1 (High)97.68
3O197.6
4Llama 3.1 405B Instruct97.34
5Qwen 2.5 32B Instruct97.16
6Llama 3.1 70B Instruct97.03
7Gemini 1.5 Pro96.99
8Llama 3.1 8B Instruct96.07
9GPT-4o95.84
10Llama 3.3 70B Instruct95.34
11Llama-3.1-Tulu-3-70B-DPO94.25
12Llama-3.1-Tulu-3-70B93.5
13Mistral 7B Instruct (v0.3)91.55
14Llama-3.1-Tulu-3-8B-DPO85.86
15Llama-3.1-Tulu-3-8B85.4

Interactive version: theaggregate.ai/benchmark?slug=abstentionbench-underspecified-context-gsm8k-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.