BeQu - Experiment 1 - Entailment F1: leaderboard

Metric: Entailment F1 (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Medium)47.2
2Kimi K2.545
3Gemini 3 Flash (Preview) (Medium)44.4
4Claude Sonnet 4.6 (Medium)43.2
5GPT-5.4 (Medium)42.1
6Gemini 3.1 Pro (Preview) (Medium)40
7Mistral Large 339.6
8DeepSeek V3.237.2
9GPT-5 Mini (Medium)35.3
10Grok 4.1 Fast33.8
11MiniMax-M2.532.3
12GPT-OSS-120B31.8
13Claude Haiku 4.529.9
14Qwen 3.5 27B29.6
15Gemma 3 27B (IT)28.2

Interactive version: theaggregate.ai/benchmark?slug=bequ-experiment-1-entailment-f1 · How It Works · Data refreshed daily, snapshot 2026-09-19.