BeQu - Experiment 1 - Entailment Precision: leaderboard

Metric: Entailment Precision (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1GPT-5 Nano (Medium)88
2Gemini 3.1 Pro (Preview) (Medium)79.2
3GPT-5.4 (Medium)76.6
4Claude Sonnet 4.6 (Medium)64.6
5Llama 4 Scout Instruct63.2
6GPT-5 Mini (Medium)62.6
7Claude Haiku 4.561.4
8MiniMax-M2.560.8
9Claude Opus 4.6 (Medium)59.6
10Kimi K2.554.4
11Mistral Large 353.4
12Grok 4.1 Fast53.2
13Qwen 3.5 27B49
14Gemini 3 Flash (Preview) (Medium)47.8
15DeepSeek V3.246

Interactive version: theaggregate.ai/benchmark?slug=bequ-experiment-1-entailment-precision · How It Works · Data refreshed daily, snapshot 2026-09-19.