BeQu - Experiment 1 - Entailment Recall: leaderboard

Metric: Entailment Recall (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview) (Medium)41.4
2Claude Opus 4.6 (Medium)39.2
3Kimi K2.538.4
4Claude Sonnet 4.6 (Medium)32.4
5Mistral Large 331.4
6DeepSeek V3.231.2
7GPT-5.4 (Medium)29
8Gemini 3.1 Pro (Preview) (Medium)26.8
9GPT-OSS-120B25.6
10Grok 4.1 Fast24.8
11GPT-5 Mini (Medium)24.6
12Gemma 3 27B (IT)24.4
13MiniMax-M2.522
14Qwen 3.5 27B21.2
15Claude Haiku 4.519.8

Interactive version: theaggregate.ai/benchmark?slug=bequ-experiment-1-entailment-recall · How It Works · Data refreshed daily, snapshot 2026-09-19.