FCMBench V1.1 - Consistency Checking: leaderboard

Metric: F1 (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3 Flash69.93
2Qwen 3 VL 32B Instruct65.53
3Claude Opus 4.563.97
4Kimi K2.563.66
5Qwen 3 VL 235B A22B Instruct62.65
6GLM-4.6V62.49
7Gemini 3 Pro60.68
8GPT-5.259.34
9GLM-4.5V59.29
10Qwen 3 VL 8B Instruct54.81
11Qwen 3.5 397B A17B54.75
12Qwen 3.5 35B A3B49.89
13Qwen 3 VL 30B A3B Instruct42.28
14Qwen 3.5 122B A10B41.96
15GPT-5.140.58

Interactive version: theaggregate.ai/benchmark?slug=fcmbench-v1-1-consistency-checking · How It Works · Data refreshed daily, snapshot 2026-09-19.